Kenapa PDF hasil scan tidak bisa dicari
Karena di dalamnya tidak ada kata-kata. Memahami apa yang sebenarnya ada di dalam file menjelaskan setiap gejalanya, dan menunjukkan satu pengaturan yang menentukan seberapa baik masalah itu bisa diperbaiki.
Terakhir ditinjau
Tidak ada kata di dalam file
PDF bisa menampung dua hal yang sama sekali berbeda tetapi tampak identik di layar. Dokumen hasil ekspor dari Word berisi teks — karakter sungguhan, masing-masing dengan posisi dan font — itulah sebabnya Anda bisa menyeleksi kalimat, mencari nama, dan menyalin paragraf. Dokumen hasil scan berisi foto sebuah halaman. Di dalamnya hanya ada piksel, persis seperti foto rambu jalan yang hanya berisi piksel.
Setiap gejala berasal dari satu fakta itu. Pencarian tidak menemukan apa-apa karena memang tidak ada yang bisa dicocokkan. Menyeleksi teks tidak berhasil karena tidak ada teks untuk diseleksi — kursor malah menggambar kotak di atas gambar. Menyalin tidak menghasilkan apa-apa. File-nya besar untuk jumlah halamannya, karena gambar itu berat dan kata-kata tidak. Dan mengubahnya ke Word menghasilkan dokumen kosong atau gambar yang ditempel di dalamnya.
Tes cepatnya: coba seleksi satu kata dengan mouse. Jika muncul kursor teks dan kata itu tersorot, berarti ada teks sungguhan. Jika yang muncul kotak, berarti itu gambar.
Apa yang sebenarnya ditambahkan OCR
Optical character recognition membaca bentuk-bentuk di dalam gambar dan menentukan huruf apa saja itu. Bagian yang berguna adalah langkah berikutnya: kata-kata yang dikenali ditulis kembali ke dalam PDF sebagai teks tak terlihat, diposisikan tepat di atas kata-kata di gambar. Halamannya tampak persis seperti sebelumnya, karena secara visual tidak ada yang berubah — tetapi kini bisa dicari, diseleksi, disalin, dan diindeks.
Itu desain yang sengaja dibuat konservatif, dan memang tepat untuk dokumen. Tidak ada yang disusun ulang, jadi kontrak tetap tampak seperti kontrak yang ditandatangani, dan hasil scan aslinya tetap menjadi catatan visual. Membuat PDF hasil scan bisa dicari melakukannya dalam satu langkah, dan biasanya sekaligus meluruskan serta memutar halaman, karena proses membacanya memang membutuhkan itu.
Jika yang Anda inginkan dokumen yang bisa diedit, bukan sekadar bisa dicari, itu pekerjaan lain yang jauh lebih sulit: teksnya harus diekstrak, tata letaknya ditebak, lalu hasilnya disusun ulang menjadi paragraf dan tabel. Mengubah ke Word melakukan hal itu, dan hasilnya selalu perlu diperiksa, sesuatu yang tidak diperlukan pada lapisan teks.
Pengaturan yang menentukan segalanya: 300 DPI
Akurasi pengenalan jauh lebih bergantung pada hasil scan daripada pada software-nya, dan angka terpenting adalah resolusi. 300 DPI adalah standarnya, dan angka itu tidak asal dipilih — resolusi itu memberi sekitar 30 piksel tinggi pada teks isi biasa, cukup jauh di atas batas minimum untuk membedakan bentuk huruf yang mirip.
Di 150 DPI, akurasi turun cukup terasa, dan kesalahannya jenis yang licik: angka 1 terbaca sebagai l, 5 sebagai S, rn sebagai m. Di bawah itu, kualitasnya turun cepat. Lebih dari 300 jarang membantu dan membuat file jauh lebih besar — 600 DPI hanya sepadan untuk huruf yang sangat kecil atau dokumen asli yang buruk.
Tiga pengaturan pengambilan lainnya hampir sama pentingnya. Grayscale, bukan hitam-putih, karena ambang batas yang keras menghancurkan bagian tipis dari huruf. Rata dan tegak lurus terhadap sensor, karena halaman yang difoto dari sudut miring punya huruf yang berubah bentuk di sepanjang halaman. Dan pencahayaan merata — kegagalan klasiknya adalah bayangan Anda sendiri yang jatuh di halaman yang Anda foto dari atas.
Yang tidak bisa dibaca OCR mana pun
Jujur soal ini menghemat banyak waktu. Tulisan tangan bersambung tidak dikenali oleh OCR serbaguna, dan alasannya struktural, bukan soal kurang berusaha: membaca huruf cetak bekerja dengan menemukan batas antarhuruf, dan pada tulisan bersambung batas itu tidak ada. Huruf cetak tulisan tangan, huruf kapital, dan kotak-kotak formulir sering berhasil dengan baik, karena bentuknya terpisah dengan celah di antaranya.
Teks yang menjadi bagian dari foto — tulisan di papan, di kemasan produk, di atas latar yang ramai — jauh lebih sulit daripada teks di atas kertas, dan huruf yang sangat bergaya atau dekoratif lebih sulit lagi. Fotokopi dari fotokopi kehilangan goresan tipis yang membedakan huruf. Dan dokumen yang diberi stempel, catatan, atau stabilo lebih sulit dibaca di bagian mana pun tanda-tanda itu menimpa teks.
Alat yang baik memberi tahu seberapa yakin hasilnya, dan angka itu ada untuk dimanfaatkan. Keyakinan rendah di tengah kalimat yang bisa Anda baca dari konteksnya jauh kurang penting dibandingkan keyakinan rendah pada satu digit nomor rekening. Kesalahan yang berbahaya justru yang dibaca dengan yakin, karena tidak ada yang menandainya.
Kenapa ini penting, bukan sekadar soal kenyamanan
Arsip hasil scan tanpa lapisan teks, secara praktis, sama dengan hilang. Tidak ada yang bisa mencarinya, tidak ada yang bisa mengindeksnya, tidak ada sistem kepatuhan yang bisa menemukan sebuah nama di dalamnya, dan tidak ada pembaca layar yang bisa membacakannya — yang di banyak yurisdiksi membuat mempublikasikannya menjadi masalah hukum, bukan sekadar ketidaknyamanan.
Itu juga alasan mengapa scan dengan pengaturan yang benar sejak awal layak diperjuangkan. Men-scan ulang satu kotak dokumen jauh lebih mahal daripada men-scan-nya dengan benar sekali, dan tidak ada pemrosesan apa pun yang bisa memulihkan detail yang tidak pernah terekam.
Pertanyaan yang sering diajukan
Seberapa akurat OCR sebenarnya?
Pada hasil scan 300 DPI yang bersih dari teks cetak biasa, sangat akurat — cukup tinggi sehingga kesalahan hanya sesekali, bukan rutin. Pada foto ponsel yang diambil miring dengan cahaya buruk, jauh lebih jelek. Kualitas scan jauh lebih berpengaruh daripada pilihan software.
Apakah OCR mengubah tampilan dokumen saya?
Tidak. Teks yang dikenali ditambahkan secara tak terlihat di atas gambar yang sudah ada, jadi halamannya tampak persis seperti sebelumnya. Halaman biasanya diluruskan dan ditegakkan sebagai bagian dari prosesnya, yang membuat hasil scan yang miring tampak lebih rapi, bukan berbeda.
Bisakah saya mengedit teksnya setelah menjalankan OCR?
Tidak di dalam PDF itu sendiri — halaman yang terlihat tetap berupa gambar, dan lapisan teksnya berada tak terlihat di atasnya. Untuk mendapatkan sesuatu yang bisa diedit, ubah dokumen yang sudah dikenali itu ke Word, dan bersiaplah memeriksa hasilnya.
Apakah OCR bisa membaca tulisan tangan?
Huruf cetak tulisan tangan yang terpisah-pisah dan formulir yang sudah diisi sering berhasil. Tulisan bersambung tidak, di alat OCR serbaguna mana pun — hurufnya menyatu tanpa batas yang bisa ditemukan. Alat yang dilatih khusus untuk tulisan tangan hasilnya lebih baik, dengan konsekuensi halaman Anda dikirim ke pihak ketiga.
Kenapa PDF saya yang sudah bisa dicari jadi jauh lebih besar?
Seharusnya ukurannya hampir tidak berubah — lapisan teks hanya beberapa kilobyte per halaman. Jika ukurannya bertambah banyak, kemungkinan halamannya dirender ulang alih-alih dipertahankan, dan itu layak diperiksa, karena inti dari lapisan teks adalah gambar aslinya tetap utuh tanpa disentuh.
Juga layak dibaca
PDF terlalu besar untuk email
Tiga penyebab PDF berukuran besar, dan solusi mana yang cocok untuk file Anda.
Format gambar mana?
Satu pertanyaan menentukannya. JPG, PNG, WebP, dan AVIF dibandingkan secara jujur.
Menyensor PDF dengan benar
Kenapa kotak hitam tidak menyembunyikan apa pun, dan tempat PDF menyimpan nama yang Anda lupakan.