Langsung ke konten

Ubah PDF Bangla ke Word

PDF Bengali — surat edaran, formulir, bab buku, hasil scan — menjadi .docx yang bisa Anda edit, dengan huruf gabungan dan tanda vokal dalam urutan yang benar, dan OCR yang disetel ke Bangla untuk halaman hasil scan. Tidak ada yang disimpan.

  • Tidak pernah disimpan
  • Tanpa antre, tanpa menunggu
  • Tanpa daftar, tanpa watermark

Cara kerjanya

1

Tambahkan PDF Anda

PDF teks atau hasil scan. Alat ini melihat halaman pertama dan menyalakan OCR untuk hasil scan; pembacanya sudah disetel ke Bengali.

2

Pilih mode

Teks yang bisa diedit menghasilkan dokumen Word biasa, halaman demi halaman. Tampilan persis menempatkan setiap baris di posisi aslinya di atas gambar halaman, untuk dicetak alih-alih diedit.

3

Konversi dan unduh

File .docx dalam font Bangla Unicode, dengan judul, paragraf, gambar, dan tautan.

Apa yang berbeda pada PDF Bangla

Pengurutan ulang adalah intinya. Lapisan teks PDF menyimpan glyph dalam urutan penggambaran, dan mesin penata aksara Bangla menggambar tanda vokal pra-basis (ি, ে, ৈ) sebelum konsonannya dan memecah ো dan ৌ menjadi dua glyph di kedua sisinya; teks yang keluar dari pengekstrak biasa karena itu berbunyi "স্ব␃াভািবক" padahal halamannya bertuliskan "স্বাভাবিক". Setiap baris dikembalikan ke urutan logis — tanda vokal setelah gugusnya, reph sebagai র্ sebelum gugus yang ditumpanginya, vokal dua bagian sebagai satu code point — sebelum hal lain terjadi. Hasil OCR tidak memerlukan semua ini, karena pembacanya sudah mengeluarkan urutan logis.

Judul, paragraf, tautan, gambar, dan pemisah halaman ditentukan persis seperti di halaman PDF ke Word umum: kata-kata yang berbagi baseline menjadi satu baris, jarak yang melebar memulai paragraf, baris pendek berukuran 1,6 kali teks isi menjadi judul, dan anotasi tautan menjadi hyperlink Word. Tampilan persis merender grafis halaman pada 144 DPI dan menempatkan teks aslinya di atasnya; Teks yang bisa diedit membangun ulang paragraf yang rapi sesuai urutan baca.

Angka Bengali dipertahankan sebagai angka Bengali, dan kata Latin di halaman — alamat email, nomor referensi — tetap Latin. Untuk hasil scan, paket Bengali-lah yang dimuat, jadi halaman Bangla dengan kop surat Inggris membaca Bangla-nya dengan benar dan mungkin membaca kop suratnya sebagai omong kosong berbentuk Bangla; tambahkan bahasa Inggris di daftar bahasa jika bahasa Inggrisnya penting.

Jika Anda butuh hal lain

PDF yang dibuat dari file Word adalah rekonstruksi yang menunggu terjadi; mintalah .docx-nya jika bisa. Dan .docx Bijoy lebih baik dikonversi dengan Bijoy ke Unicode daripada dicetak ke PDF lalu dikonversi balik — ketikannya terkonversi tanpa satu pun kesalahan, formatnya terjaga, dan tidak ada yang dibaca ulang dari piksel.

Untuk arsip buku Bangla hasil scan, alat OCR desktop dengan model Bengali membaca satu folder dalam semalam, dan OCRmyPDF menambahkan lapisan yang bisa dicari ke setiap PDF tanpa mengubah tampilannya — bentuk alat yang tepat untuk ratusan file, sementara halaman ini untuk satu file.

Pertanyaan yang sering diajukan

Apakah PDF saya disimpan?

Tidak. Tidak ada yang disimpan; file Anda tidak pernah disimpan. Untuk hasil scan, pembaca dan paket Bengali diambil dari situs ini sekali lalu disimpan untuk penggunaan berikutnya — dokumennya sendiri tidak pergi ke mana pun.

Mengapa Bangla dari PDF biasanya keluar dengan ejaan kacau?

Karena PDF menyimpan glyph dalam urutan penggambarannya, yang untuk Bangla adalah urutan visual: i-kar digambar sebelum konsonan yang diikutinya, dan dua belahan ো berada di kedua sisinya. Kebanyakan konverter menyalin urutan itu apa adanya, jadi বাংলাদেশ keluar dengan tanda vokal di depan huruf yang salah dan setiap kata salah eja dengan cara yang tidak bisa diperbaiki pemeriksa ejaan. Konverter ini mengembalikan tanda-tanda itu ke tempat yang diinginkan Unicode — pengurutan ulang yang sama yang dibutuhkan setiap PDF Bangla, termasuk yang dibuat situs ini.

Apakah PDF yang dibuat dari dokumen Bijoy bisa ditangani?

Jika PDF punya lapisan teks dalam SutonnyMJ, teksnya keluar sebagai ketikan Bijoy, karena itulah yang ada di dalam file; jalankan hasilnya lewat Bijoy ke Unicode dan formatnya tetap terjaga. Jika PDF-nya hasil scan, OCR membaca gambarnya dan langsung memberikan Unicode.

Seberapa baik OCR pada hasil scan Bangla?

Hasil scan bersih 300 dpi dari Bangla cetak terbaca dengan baik; fotokopi pudar dan foto ponsel kehilangan huruf gabungan. Bahasanya dikunci ke Bengali di halaman ini, jadi kop surat Latin atau nomor referensi tidak bisa mendorong pembaca ke bahasa Inggris untuk seluruh halaman. Halaman yang terscan miring diluruskan dulu.

Format Word apa yang saya dapatkan?

File .docx standar, dipasang dalam font Bangla Unicode, yang terbuka di Word, Google Docs, dan LibreOffice. Teksnya Unicode sungguhan: bisa dicari, dan bisa diketik lanjut dengan Avro atau Ridmik.

Bagaimana dengan tabel dan formulir?

Formulir bergaris dalam hasil scan menjadi tabel Word sungguhan dalam mode Teks yang bisa diedit. Tabel dalam PDF teks keluar sebagai teks yang diposisikan, seperti pada setiap konverter PDF ke Word — untuk spreadsheet, PDF ke Excel adalah alat yang lebih baik.

Perlu diketahui: Font diganti: .docx memakai font Bangla Unicode, bukan font PDF-nya sendiri, jadi tampilannya mirip, bukan identik. PDF teks yang dipasang dalam font Bijoy terkonversi sebagai ketikan Bijoy dan sesudahnya memerlukan konverter Bijoy ke Unicode. OCR mengabaikan foto dan logo, membiarkan tulisan tangan sebagai gambar, dan butuh beberapa detik per halaman, karena perangkat Anda sendiri yang membacanya.

Pasang alat ini di situs Anda

Gratis untuk blog, halaman kelas, atau artikel bantuan apa pun. Tempel satu potong kode dan pengunjung Anda bisa langsung memakainya di halaman Anda.