Langsung ke konten

Ubah PDF ke teks

Ambil kata-kata dari PDF dengan baris dan paragraf tetap utuh — salin langsung ke clipboard atau unduh sebagai file .txt. Tidak ada yang disimpan.

  • Tidak pernah disimpan
  • Tanpa antre, tanpa menunggu
  • Tanpa daftar, tanpa watermark

Cara kerjanya

1

Tambahkan PDF Anda

Letakkan PDF di halaman ini. Ekstraksi langsung dimulai, halaman demi halaman.

2

Baca dan sesuaikan

Teks muncul di kotak yang bisa diedit. Aktifkan atau matikan penanda pergantian halaman, dan edit apa saja sebelum menyimpan.

3

Salin atau unduh

Klik Salin semua untuk menyalin ke clipboard, atau unduh sebagai file .txt.

Dari mana kata-kata itu berasal, dan dalam urutan apa ia keluar

Karakter di dalam PDF tidak disimpan sebagai teks. Karakter disimpan sebagai nomor glyph yang merujuk ke font tertanam, dan mengubahnya kembali menjadi huruf bergantung pada tabel di dalam file yang menyatakan karakter apa yang diwakili setiap glyph. Sebagian besar pembuat PDF menyertakannya. Jika tidak — dan subset font yang dipangkas oleh sebagian software desain biasanya biang keladinya — halaman tampak sempurna di layar tetapi hasil ekstraksinya kacau, karena informasi yang dibutuhkan untuk membacanya memang tidak pernah ditulis. Tidak ada alat ekstraksi yang bisa memperbaikinya; masalahnya adalah data yang hilang, bukan soal yang sulit dipecahkan.

Urutan baca adalah hal yang perlu diperiksa sebelum Anda memercayai hasilnya. Teks keluar sesuai urutan halaman menggambarnya, yaitu urutan yang kebetulan dipakai software pembuat PDF — dan itu sering kali bukan urutan orang membaca. Halaman dua kolom sering terekstrak sebagai kolom kiri dan kolom kanan yang terpisah dengan benar, atau sebagai baris yang berselang-seling di antara keduanya, sepenuhnya tergantung cara PDF itu dibuat. Header, footer, nomor halaman, dan sidebar muncul di mana pun mereka digambar, biasanya di tengah-tengah paragraf.

Beberapa artefak kecil lebih baik dikenali daripada membuat Anda bingung. Ligatur keluar sebagai satu karakter yang memang dipakai font, jadi "find" bisa muncul sebagai satu glyph, bukan f diikuti i, sehingga pencarian sederhana untuk "find" tidak menemukannya. Kata yang dipenggal di akhir baris tetap berisi tanda hubung, karena pemenggalan itu memang ada di file. Dan tanda kutip lurus sering kali berupa kutip melengkung, yang penting diperhatikan jika teksnya akan dipakai di kode atau CSV.

Halaman hasil scan sama sekali tidak menghasilkan teks, dan alat ini memberi tahu Anda alih-alih menyerahkan file kosong — foto dokumen tidak berisi karakter, hanya piksel. Hal yang sama berlaku untuk teks yang sudah diubah menjadi outline, yang sengaja dilakukan desainer agar file tercetak sama persis di mana saja; pada titik itu, teks tersebut benar-benar sudah menjadi gambar. Keduanya membutuhkan OCR, bukan ekstraksi.

Jika Anda butuh hal lain

Jika kolom penting, pdftotext -layout in.pdf out.txt dari Poppler lebih baik daripada apa pun yang bisa dilakukan browser: alat ini merekonstruksi jarak visual dengan spasi sungguhan, sehingga kolom tetap kolom dan tabel tetap tabel yang bisa dibaca. pdftotext -raw melakukan sebaliknya dan memberikan urutan gambar apa adanya, yang kadang justru dibutuhkan oleh sebuah skrip.

Untuk mengambil teks dari ratusan file, mutool draw -F txt dan pdfplumber di Python adalah fondasi yang tepat — pdfplumber khususnya memberi Anda setiap karakter lengkap dengan koordinat, font, dan ukurannya, sehingga header dan footer bisa disaring berdasarkan posisi, bukan tebakan. Itulah pekerjaan yang tidak bisa dilakukan halaman ini, dan itulah yang penting untuk volume besar.

Pertanyaan yang sering diajukan

Apakah paragraf dan baris baru tetap terjaga?

Ya. PDF sama sekali tidak menyimpan paragraf — hanya karakter di titik koordinat tertentu — jadi teks disusun ulang dengan mengelompokkan kata yang berada di garis dasar yang sama dan memulai paragraf baru saat jarak vertikalnya melebar. Hasilnya terbaca seperti aslinya, bukan satu aliran teks tanpa putus.

Apakah PDF saya disimpan di suatu tempat?

Tidak. Teks dibaca oleh browser Anda sendiri dan tidak pernah dikirim ke mana pun. Anda bahkan bisa memutus koneksi internet setelah halaman dimuat, dan alat ini tetap berfungsi.

Muncul pesan bahwa PDF saya tidak punya teks — kenapa?

Karena PDF itu hasil scan atau foto: halamannya berupa gambar, dan gambar tidak berisi teks yang bisa diambil. Gunakan OCR PDF, yang membaca kata-kata langsung dari gambarnya.

Bisakah saya mengedit teks sebelum mengunduh?

Bisa — kotaknya bisa diedit sepenuhnya, dan apa yang Anda lihat persis itulah yang disimpan.

Bagaimana dengan tabel dan kolom?

Kolom dibaca sesuai urutan PDF menggambarnya. Biasanya urutan itu benar, tetapi pada tata letak multikolom yang rumit, baris dari kolom berbeda bisa bercampur. Tabel keluar sebagai baris-baris teks, bukan sebagai kisi — untuk tabel, gunakan PDF ke Excel.

Perlu diketahui: Teks biasa tidak membawa format apa pun: huruf tebal, ukuran, warna, gambar, dan struktur tabel pasti hilang. Teks yang digambar sebagai kurva vektor, bukan karakter sungguhan (umum pada logo dan beberapa PDF buatan desainer), tidak bisa diambil oleh alat mana pun tanpa OCR.

Pasang alat ini di situs Anda

Gratis untuk blog, halaman kelas, atau artikel bantuan apa pun. Tempel satu potong kode dan pengunjung Anda bisa langsung memakainya di halaman Anda.