Langsung ke konten

Buat PDF hasil scan bisa dicari

Baca kata-kata dari hasil scan lalu tempatkan secara tak terlihat di atas halamannya. Tampilan dokumen tetap sama — hanya saja kini bisa dicari, dipilih, dan disalin. Halaman yang ter-scan miring atau menyamping diluruskan.

  • Tidak pernah disimpan
  • Tanpa antre, tanpa menunggu
  • Tanpa daftar, tanpa watermark

Cara kerjanya

1

Tambahkan PDF hasil scan

Letakkan file-nya. Alat ini memeriksa apakah file sudah punya lapisan teks dan memberi tahu Anda jika OCR justru akan menurunkan kualitas.

2

Periksa bahasanya

Alat ini membaca halaman pertama dan memberi tahu bahasa yang ditemukannya. Tersedia lebih dari 120 bahasa jika Anda perlu memilih sendiri.

3

Unduh

Anda mendapatkan dokumen yang sama, kini dengan lapisan teks tersembunyi di balik hasil scan.

Lapisan tak terlihat di atas halaman yang tidak berubah

Hasil scan dipertahankan persis seperti aslinya. Yang ditambahkan adalah lapisan teks yang digambar dalam mode render tak terlihat — karakter sungguhan, ditempatkan kata demi kata di atas kata-kata pada gambar, dan ditandai agar tidak pernah digambar. Halaman tampak identik karena secara visual tidak ada yang berubah; pilih sebuah kalimat dan sorotannya jatuh di kata yang tepat, karena teks tak terlihat itu berada di tempat tinta yang terlihat. Inilah cara standar membuat hasil scan yang bisa dicari, dan itulah sebabnya hasilnya bisa dicari, disalin, dan diindeks meskipun tetap berupa foto sebuah dokumen.

Dua hal pada halaman sengaja dikoreksi, karena proses membaca memang memerlukannya. Halaman yang ter-scan menyamping ditegakkan, dan halaman yang masuk feeder dengan miring diluruskan — sehingga hasilnya sering lebih rapi daripada aslinya. Ukuran halaman dipertahankan dari PDF asli, bukan diseragamkan, sehingga dokumen dengan ukuran halaman campuran tetap seperti itu dan tidak ada yang diubah skalanya.

Akurasi hampir sepenuhnya bergantung pada hasil scan, dan selisihnya jauh. Hasil scan teks cetak yang bersih pada 300 DPI terbaca dengan akurasi sangat tinggi; halaman yang sama pada 150 DPI terbaca jauh lebih buruk; foto yang diambil miring dalam cahaya kurang adalah persoalan yang sama sekali berbeda. Jika Anda yang mengatur proses scan, 300 DPI dalam grayscale adalah pengaturan yang penting — resolusi lebih tinggi jarang membantu, dan resolusi lebih rendah langsung merugikan. Huruf kecil, spasi baris yang rapat, latar berwarna, fotokopi dari fotokopi, serta apa pun yang dicap atau ditulis tangan semuanya lebih sulit, dengan cara yang belum bisa diselesaikan sepenuhnya oleh software mana pun.

Apa yang sengaja ditinggalkan sama pentingnya dengan apa yang dimasukkan. Foto, logo, tanda tangan, dan grafis dekoratif diabaikan, bukan dibaca, karena memaksa huruf keluar dari gambar menghasilkan omong kosong yang tampak masuk akal dan kemudian muncul di setiap pencarian. Kata-kata Mandarin, Jepang, dan Korea dikenali tetapi tidak dimasukkan ke lapisan teks dan dihitung untuk Anda, alih-alih ditulis sebagai kosong, sampai font yang bisa memuatnya tersedia. Tidak ada yang menyusun ulang tata letak dokumen di sini: kata-kata di halaman tetap berupa gambar, dan mengubahnya ke Word adalah alat untuk menjadikannya teks yang bisa diedit.

Jika Anda butuh hal lain

OCRmyPDF adalah alat yang menjadi pembanding halaman praktis ini, dan gratis. ocrmypdf --deskew --rotate-pages in.pdf out.pdf melakukan pekerjaan yang sama dengan kontrol lebih besar, ditambah --optimize 3 untuk memperkecil hasilnya, --redo-ocr untuk mengganti lapisan lama yang buruk, dan --output-type pdfa untuk menghasilkan file arsip dalam satu proses. Alat ini sanggup menangani ribuan halaman, bisa berjalan sebagai pemantau folder, dan itulah yang benar-benar dipakai perpustakaan dan arsip dokumen.

Untuk materi yang sulit — cetakan bersejarah, tata letak tidak lazim, tabel yang padat — layanan cloud dari Google, Amazon, atau Microsoft bisa membaca halaman yang tidak sanggup dibaca pengenalan teks umum, karena dilatih dengan materi yang jauh lebih banyak. Itu perbedaan kemampuan yang nyata dan perlu Anda ketahui. Namun itu juga berarti mengirim dokumen Anda ke pihak ketiga, persis hal yang ingin dihindari oleh halaman ini — jadi itu pilihan tepat untuk buku tua yang rapuh, dan pilihan yang salah untuk sekotak rekam medis.

Pertanyaan yang sering diajukan

Apakah tampilan halaman akan berubah?

Hanya menjadi lebih lurus: halaman yang ter-scan sedikit miring atau menyamping ditegakkan. Hasil scan-nya tetap disimpan di dokumen, dan kata-kata yang dikenali ditempatkan di atasnya dengan tinta tak terlihat — tidak pernah digambar, tidak pernah dicetak. Yang berubah adalah Ctrl+F mulai bisa menemukan sesuatu.

Apakah dokumen saya disimpan di suatu tempat?

Tidak. Proses pengenalan tidak menyimpan apa pun. Mesin pembaca dan paket bahasanya diambil dari situs ini saat pertama kali Anda memakai suatu bahasa; dokumennya sendiri tidak pernah meninggalkan perangkat.

Seberapa akurat hasilnya?

Untuk hasil scan teks cetak yang bersih, sangat akurat. Foto buram, tulisan tangan, dan font yang tidak lazim menurunkan akurasinya; kemiringan dikoreksi sebelum dibaca. Tabel bergaris dibaca sel demi sel, sehingga label formulir tidak bercampur dengan isinya.

Bahasa apa saja yang didukung?

Lebih dari 120, termasuk Inggris, Bengali, Hindi, Urdu, Arab, Spanyol, Prancis, Mandarin, Jepang, dan Korea. Aksaranya dideteksi dari halaman; jika beberapa bahasa memakai aksara yang sama, bahasa browser Anda dipakai sebagai penentu, dan Anda bisa mengubahnya.

Beberapa kata tidak ada di lapisan teks. Mengapa?

Lapisan teks hanya bisa memuat karakter yang bisa ditulis oleh font bawaan. Bengali, Dewanagari, Arab, Thai, dan dua lusin aksara lainnya punya font sendiri di sini; Mandarin, Jepang, dan Korea belum, sehingga kata-kata tersebut dihitung untuk Anda alih-alih disimpan sebagai kosong. PDF ke Word dengan OCR memberi Anda teks itu secara lengkap.

Berapa lama prosesnya?

Beberapa detik per halaman, karena perangkat Anda sendirilah yang membaca, bukan server farm. Progresnya ditampilkan halaman demi halaman.

Perlu diketahui: Kata-kata Mandarin, Jepang, dan Korea tidak dimasukkan ke lapisan teks dan dihitung untuk Anda, alih-alih disimpan sebagai kosong, sampai font untuk aksara itu tersedia; semua aksara lain yang dikenal mesin pembaca akan ditulis. Foto, logo, dan tanda tangan diabaikan agar tidak pernah menjadi teks yang tidak bermakna. Tulisan tangan tidak bisa dikenali secara andal oleh alat OCR umum mana pun.

Pasang alat ini di situs Anda

Gratis untuk blog, halaman kelas, atau artikel bantuan apa pun. Tempel satu potong kode dan pengunjung Anda bisa langsung memakainya di halaman Anda.