Langsung ke konten

Ubah PDF ke Excel

Ambil tabel dari PDF ke .xlsx sungguhan yang bisa Anda urutkan, filter, dan jumlahkan — disusun ulang dari halaman itu sendiri.

  • Tidak pernah disimpan
  • Tanpa antre, tanpa menunggu
  • Tanpa daftar, tanpa watermark

Cara kerjanya

1

Tambahkan PDF Anda

Letakkan dokumen yang berisi tabel yang Anda perlukan.

2

Konversi

Baris dikenali dari baseline yang sama, dan kolom dari titik awal teks di halaman.

3

Unduh

Satu sheet per halaman, bisa dibuka di Excel, Google Sheets, Numbers, dan LibreOffice.

Bagaimana grid dipulihkan dari sesuatu yang tidak punya grid

PDF tidak berisi tabel. Isinya karakter pada koordinat, dan garis-garis yang tampak seperti tabel hanyalah gambar yang tidak berhubungan dengan teks di dalamnya. Jadi grid-nya disimpulkan, dengan dua aturan yang perlu diketahui secara persis. Baris berasal dari baseline yang sama, dengan posisi vertikal dibulatkan ke kelompok empat poin agar superscript atau simbol mata uang yang sedikit terangkat tidak memulai baris sendiri. Kolom berasal dari pengumpulan setiap tepi kiri yang berbeda di halaman, lalu menggabungkan dua tepi yang jaraknya dalam delapan poin — dilakukan di seluruh halaman, bukan per baris, sehingga kolom yang kebetulan kosong di satu baris tetap mempertahankan posisinya di baris lain.

Itulah sebabnya angka rata kanan menjadi kasus sulit, dan ini perlu dikatakan terus terang karena inilah kekecewaan paling umum di sini. Kolom angka yang rata kanan punya tepi kiri yang berbeda di setiap baris — 9.99 dimulai jauh di sebelah kanan 1,234,567.89 — dan begitu tepi-tepi itu berselisih lebih dari delapan poin, keduanya dibaca sebagai kolom yang berbeda. Akibatnya, tabel keuangan bisa tiba tersebar di beberapa kolom yang seharusnya satu. Kolom rata kiri dan rata tengah tidak mengalami masalah ini. Dua potong teks yang memang jatuh di sel yang sama digabungkan dengan spasi, bukan saling menimpa.

Tipe sel ditentukan saat ditulis: apa pun yang terurai dengan bersih sebagai angka ditulis sebagai angka dan bisa dijumlahkan, dan selebihnya ditulis sebagai teks. Hiasan akuntansi yang lazim tidak terurai — pemisah ribuan, tanda persen di belakang, simbol mata uang, atau angka negatif yang ditulis dalam kurung seperti (1,234) — jadi sel-sel itu tiba sebagai teks yang tampak seperti angka tetapi tidak bisa dijumlahkan. Fitur Text to Columns di Excel sendiri memperbaiki satu kolom penuh sekaligus.

Setiap halaman menjadi sheet tersendiri, bernama Page 1, Page 2, dan seterusnya, alih-alih disambung menjadi satu tabel panjang — tabel tiga halaman tiba sebagai tiga sheet dengan header yang berulang. Yang terbawa hanya nilainya. Rumus memang tidak pernah ada di PDF untuk dipulihkan, sedangkan warna isian, garis tepi, font, sel gabungan, dan grafik sengaja tidak direkonstruksi, karena menebak-nebaknya menghasilkan spreadsheet yang tampak meyakinkan tetapi diam-diam keliru.

Jika Anda butuh hal lain

Ekstraksi tabel adalah masalah riset tersendiri, dan ada alat yang tidak mengerjakan hal lain. Tabula adalah pilihan utama jika tabelnya bergaris: alat ini membaca garis yang tergambar sebagai grid alih-alih menyimpulkannya dari posisi teks, sehingga kasus angka rata kanan langsung terpecahkan. Tabula gratis, punya antarmuka tunjuk-dan-klik, dan mengekspor CSV. Camelot melakukan hal yang sama dari Python, dengan mode lattice untuk tabel bergaris dan mode stream untuk tabel tanpa garis, dan akan memberi tahu seberapa yakin hasilnya.

Jika tata letaknya sederhana dan Anda hanya ingin hasilnya terbaca, pdftotext -layout in.pdf out.txt dari Poppler mempertahankan jarak antarkolom sebagai teks biasa, yang bisa langsung dibuka di spreadsheet sebagai data lebar tetap dan sama sekali melewati proses penyimpulan. Dan jika PDF-nya hasil scan, semua ini tidak berlaku — tidak ada teks untuk diposisikan, dan PDF itu perlu OCR terlebih dahulu.

Pertanyaan yang sering diajukan

Bagaimana tabel PDF bisa menjadi spreadsheet?

PDF tidak mengenal konsep tabel — hanya karakter pada koordinat. Grid-nya dibangun ulang: teks yang berbagi baseline menjadi satu baris, dan tepi kiri teks di seluruh halaman dikelompokkan menjadi kolom, sehingga sel yang kosong di satu baris tetap mempertahankan posisinya di baris lain.

Seberapa akurat hasilnya?

Sangat baik pada tabel bergaris yang rapi dengan kolom yang konsisten. Hasilnya kurang baik pada sel gabungan, teks yang terbungkus di dalam sel, dan kolom yang bergeser di sepanjang halaman — semuanya memang ambigu tanpa mengetahui makna tabelnya. Periksa hasilnya sebelum mengandalkannya.

Apakah angka tetap menjadi angka?

Ya. Apa pun yang terbaca sebagai angka ditulis sebagai sel numerik, jadi total dan rumus langsung berfungsi, tidak diperlakukan sebagai teks.

Apakah PDF saya disimpan di suatu tempat?

Tidak. Setiap halaman dibaca tanpa disimpan.

Bagaimana dengan PDF hasil scan?

Tidak ada teks yang bisa diambil dari hasil scan. Jalankan OCR PDF terlebih dahulu, lalu konversi.

Perlu diketahui: Sel gabungan, sel multibaris, dan kolom yang bergeser adalah kasus sulit dan mungkin perlu dirapikan setelahnya. Format, warna, rumus, dan grafik tidak dibuat ulang — hanya nilainya. Setiap halaman PDF menjadi sheet tersendiri, tidak disambung menjadi satu tabel panjang.

Pasang alat ini di situs Anda

Gratis untuk blog, halaman kelas, atau artikel bantuan apa pun. Tempel satu potong kode dan pengunjung Anda bisa langsung memakainya di halaman Anda.