Langsung ke konten

Baca teks Bangla dari gambar

Arahkan ke foto halaman, hasil scan, atau screenshot dan dapatkan teks Bengali-nya kembali sebagai Unicode — bisa dicari, bisa diedit, dan siap ditempel. Pembacanya sudah disetel ke Bangla sebelum gambar tiba, jadi tidak ada yang perlu dideteksi dan tidak ada yang perlu dipilih. Gambar Anda tidak pernah disimpan.

  • Tidak pernah disimpan
  • Tanpa antre, tanpa menunggu
  • Tanpa daftar, tanpa watermark

Cara kerjanya

1

Tambahkan gambar

Foto halaman buku, surat edaran lama, sertifikat hasil scan, atau screenshot teks Bangla. JPG, PNG, WebP, HEIC, dan TIFF semuanya bisa; foto yang diambil miring diluruskan dulu.

2

Biarkan dibaca

Bengali sudah terpilih. Jika halaman juga memuat bahasa Inggris — formulir, kop surat — tambahkan dari daftar dan keduanya dibaca.

3

Salin sebagai Unicode

Teks keluar dalam Unicode, apa pun font cetakan aslinya: surat edaran dalam SutonnyMJ terbaca sebagai Bangla biasa, bukan sebagai "evsjv‡`k". Pertahankan tata letak atau gabungkan barisnya, lalu salin atau unduh.

Apa pengaruh Bangla pada pembacaan

Model Bengali membaca gugus, bukan huruf. Huruf gabungan seperti ক্ষ atau ন্ত্র adalah satu bentuk di halaman, dan model harus memutuskan sekaligus apa bentuk itu dan bagaimana ia terurai menjadi Unicode — itu sebabnya salah baca dalam Bangla biasanya menghasilkan huruf gabungan yang salah atau tanda vokal di huruf yang salah, bukan huruf yang salah begitu saja. Hasilnya dalam urutan yang diharapkan Unicode: tanda vokal mengikuti gugus konsonannya, reph ditulis sebagai র + hasanta sebelum gugus yang ditumpanginya, dan vokal dua bagian keluar sebagai satu code point. Itulah urutan yang diharapkan setiap kotak pencarian, pemeriksa ejaan, dan font, dan kebalikan dari urutan visual yang dipakai pengetik Bijoy.

Semua yang dilakukan pembaca biasa dilakukan di sini juga: kertas diratakan, halaman diluruskan, tabel bergaris dibaca sel demi sel sehingga label dan nilainya tetap terpisah, dan hasilnya kembali dengan tata letak seperti halaman aslinya atau digabungkan menjadi paragraf. Angka dibaca sebagai angka Bengali jika dicetak sebagai angka Bengali; formulir yang mencampur ০১২ dan 012 mempertahankan keduanya.

Bengali tidak berbagi model dengan bahasa lain, tetapi gambarnya mungkin tetap memuat bahasa Inggris — kop surat, nomor referensi, blok tanda tangan — dan satu bahasa membaca bahasa lainnya sebagai omong kosong. Menambahkan bahasa Inggris dari daftar membaca halaman dengan kedua paket dan menjaga setiap kata dalam aksara tempat ia dicetak.

Jika Anda butuh hal lain

Dokumen Bijoy yang masih ada sebagai file lebih baik dikonversi daripada difoto. OCR membangun ulang teks dari piksel dan salah beberapa karakter dari seribu bahkan pada halaman terbaik; konverter Bijoy ke Unicode membangunnya ulang dari ketikan dan tidak salah satu pun, serta menjaga huruf tebal dan tabelnya. Fotolah halaman hanya jika file-nya sudah tidak ada.

Untuk satu buku utuh atau arsip hasil scan, alat desktop adalah bentuk yang tepat: alat OCR baris perintah dengan model Bengali yang sama membaca satu folder dalam semalam, dan OCRmyPDF menambahkan lapisan teks yang bisa dicari ke setiap PDF di dalamnya. Halaman ini untuk halaman yang ada di depan Anda.

Pertanyaan yang sering diajukan

Apakah gambar saya disimpan di suatu tempat?

Tidak. Paket bahasa diambil dari situs ini saat pertama kali Anda memakai suatu bahasa; gambarnya sendiri tidak pernah disimpan dan tidak pernah dikirim ke mana pun, jadi alat ini tetap berfungsi saat Wi-Fi mati.

Seberapa baik alat ini membaca Bangla?

Bangla cetak dalam jenis huruf yang umum — SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi, buku, atau koran — yang difoto lurus dan fokus terbaca dengan baik, dengan sesekali huruf gabungan yang salah pada halaman yang buram atau pudar. Kesalahannya khas aksara ini: reph atau tanda vokal pada huruf yang belum pernah dilihat model dalam bentuk itu, dan huruf gabungan yang dicetak kecil. Hasil scan yang jernih pada 300 dpi terbaca lebih baik daripada foto ponsel, dan foto ponsel di bawah cahaya siang terbaca lebih baik daripada di bawah lampu neon.

Apakah bisa dipakai untuk dokumen Bijoy?

Ya, dan itu salah satu kegunaan terbaiknya. OCR membaca gambar hurufnya, bukan code point font-nya, jadi halaman yang diketik dalam SutonnyMJ langsung keluar sebagai Bangla Unicode — tanpa perlu konversi. Untuk file Word yang masih dalam Bijoy (teks, bukan gambar), gunakan Bijoy ke Unicode, yang menjaga format dan tidak membuat kesalahan baca.

Mengapa Bangla punya halaman terpisah?

Karena deteksi memakan waktu dan lebih sering salah untuk Bangla dibanding aksara lain: halaman dengan kop surat Latin, stempel, atau angka bisa terbaca sebagai bahasa Inggris, dan hasilnya satu halaman omong kosong yang tampak meyakinkan. Menetapkan bahasa sebelum gambar tiba berarti paket Bengali mulai diunduh begitu halaman dibuka, dan pembacanya tidak pernah mengaudisi bahasa yang salah. Halaman Gambar ke Teks biasa melakukan pekerjaan yang sama dengan deteksi menyala, untuk gambar dalam bahasa apa pun.

Bisakah membaca tulisan tangan?

Huruf cetak tulisan tangan kadang bisa; tulisan tangan bersambung tidak, dalam Bangla maupun aksara lain — itu berlaku untuk setiap alat OCR umum. Halaman Tulisan Tangan ke Teks menyatakannya dengan terus terang dan menunjukkan apa yang berhasil dibacanya.

Bagaimana dengan PDF hasil scan?

Gunakan PDF Bangla ke Word untuk satu dokumen utuh: setiap halaman dibaca dengan cara yang sama dan Anda mendapatkan .docx. Halaman ini untuk satu gambar.

Perlu diketahui: Hanya teks cetak: tulisan tangan bersambung tidak dikenali. Jenis huruf Bangla dekoratif, teks di atas foto, dan cetakan yang sangat pudar keluar tidak lengkap. Bahasa Assam adalah paket terpisah — tambahkan dari daftar jika halamannya berbahasa Assam. Hasilnya berupa teks biasa: tebal, warna, dan gambarnya sendiri tidak ikut terbawa.

Pasang alat ini di situs Anda

Gratis untuk blog, halaman kelas, atau artikel bantuan apa pun. Tempel satu potong kode dan pengunjung Anda bisa langsung memakainya di halaman Anda.