Chuyển PDF tiếng Bengal sang Word
Một PDF tiếng Bengal — công văn, biểu mẫu, chương sách, bản scan — thành file .docx bạn chỉnh sửa được, với chữ ghép và dấu nguyên âm đúng thứ tự, và OCR đặt sẵn sang Bangla cho các trang scan. Không lưu trữ gì cả.
- Không bao giờ lưu trữ
- Không xếp hàng, không phải chờ
- Không cần đăng ký, không watermark
Cách hoạt động
Thêm file PDF
PDF chữ hoặc bản scan. Công cụ xem trang đầu và bật OCR nếu là bản scan; bộ đọc đã được đặt sẵn sang tiếng Bengal.
Chọn chế độ
Văn bản chỉnh sửa được cho một tài liệu Word bình thường, khớp từng trang. Giống hệt bản gốc ghim từng dòng đúng vị trí cũ trên nền ảnh của trang, để in chứ không để chỉnh sửa.
Chuyển đổi và tải xuống
Một file .docx dùng font Bangla Unicode, với tiêu đề, đoạn văn, hình ảnh và liên kết.
PDF Bangla có gì khác
Việc sắp lại thứ tự chính là trọng tâm. Lớp chữ của PDF giữ các glyph theo thứ tự vẽ, và bộ tạo hình chữ Bangla vẽ các dấu nguyên âm đứng trước (ি, ে, ৈ) trước phụ âm và tách ো, ৌ thành hai glyph ở hai bên phụ âm; vì thế chữ lấy ra từ một bộ trích xuất thông thường là "স্ব␃াভািবক" trong khi trang in "স্বাভাবিক". Mỗi dòng được đưa về thứ tự logic — dấu nguyên âm sau cụm của nó, reph là র্ trước cụm nó nằm trên, nguyên âm hai phần thành một mã ký tự — trước mọi bước khác. Kết quả OCR không cần bước này, vì bộ đọc đã xuất ra theo thứ tự logic.
Tiêu đề, đoạn văn, liên kết, hình ảnh và ngắt trang được xác định đúng như trên trang Chuyển PDF sang Word thông thường: các từ cùng một đường cơ sở là một dòng, khoảng cách giãn rộng bắt đầu một đoạn, một dòng ngắn có cỡ chữ 1,6 lần chữ thân bài là tiêu đề, và một chú thích liên kết thành hyperlink Word. Giống hệt bản gốc kết xuất hình họa của trang ở 144 DPI và đặt chữ thật lên trên; Văn bản chỉnh sửa được dựng lại các đoạn văn gọn gàng theo thứ tự đọc.
Chữ số Bengal được giữ là chữ số Bengal, và một từ Latin trên trang — địa chỉ email, số tham chiếu — vẫn là Latin. Với bản scan, gói được nạp là gói tiếng Bengal, nên một trang Bangla có tiêu đề thư tiếng Anh sẽ đọc đúng phần Bangla và có thể đọc tiêu đề thư thành thứ vô nghĩa mang hình dạng Bangla; hãy thêm tiếng Anh vào danh sách ngôn ngữ nếu phần tiếng Anh quan trọng.
Khi bạn cần công cụ khác
Một PDF tạo từ file Word là một bản dựng lại chờ sẵn; hãy xin file .docx nếu có thể. Và một file .docx Bijoy nên chuyển bằng Chuyển Bijoy sang Unicode hơn là in ra PDF rồi chuyển ngược lại — các phím gõ chuyển đổi không sai một ký tự, định dạng được giữ, và không có gì phải đọc lại từ pixel.
Với một kho sách Bangla scan, một công cụ OCR trên máy tính dùng mô hình tiếng Bengal đọc cả thư mục qua một đêm, và OCRmyPDF thêm lớp tìm kiếm được cho từng PDF mà không làm thay đổi bề ngoài — hình dạng công cụ phù hợp cho hàng trăm file, còn trang này dành cho một file.
Câu hỏi thường gặp
File PDF của tôi có bị lưu lại không?
Không. Không lưu trữ gì cả; file không bao giờ bị lưu giữ. Với bản scan, bộ đọc và gói tiếng Bengal được tải từ trang này một lần rồi giữ lại cho lần sau — bản thân tài liệu không đi đâu cả.
Vì sao chữ Bangla lấy từ PDF thường bị sai chính tả?
Vì PDF lưu các glyph theo thứ tự vẽ, mà với Bangla là thứ tự hiển thị: i-kar được vẽ trước phụ âm mà nó đi sau, và hai nửa của ো nằm hai bên phụ âm. Hầu hết công cụ chuyển đổi sao chép nguyên thứ tự đó, nên বাংলাদেশ ra với dấu nguyên âm đứng trước nhầm chữ cái và mọi từ đều sai chính tả theo cách trình kiểm tra chính tả không sửa được. Công cụ này đặt các dấu về đúng chỗ Unicode yêu cầu — cùng phép sắp lại mà mọi PDF Bangla đều cần, kể cả những PDF do chính trang này tạo ra.
Có xử lý được PDF tạo từ tài liệu Bijoy không?
Nếu PDF có lớp chữ bằng SutonnyMJ, chữ ra dưới dạng các phím gõ Bijoy, vì đó là thứ nằm trong file; hãy đưa kết quả qua Chuyển Bijoy sang Unicode và định dạng vẫn được giữ. Nếu PDF là bản scan, OCR đọc hình ảnh và cho ra Unicode ngay.
OCR trên bản scan Bangla tốt đến mức nào?
Bản scan sạch ở 300 dpi của chữ Bangla in đọc tốt; bản photocopy phai màu và ảnh điện thoại mất chữ ghép. Ngôn ngữ được cố định là tiếng Bengal trên trang này, nên một tiêu đề thư Latin hay một số tham chiếu không thể đẩy bộ đọc sang tiếng Anh cho cả trang. Trang scan bị lệch được làm thẳng trước.
Tôi nhận được định dạng Word nào?
Một file .docx tiêu chuẩn, dùng font Bangla Unicode, mở được trong Word, Google Docs và LibreOffice. Chữ là Unicode thực sự: tìm kiếm được, và gõ tiếp được bằng Avro hay Ridmik.
Còn bảng và biểu mẫu thì sao?
Biểu mẫu có kẻ dòng trong bản scan thành bảng Word thực sự ở chế độ Văn bản chỉnh sửa được. Bảng trong PDF chữ ra thành chữ đặt theo vị trí, như mọi công cụ chuyển PDF sang Word — với bảng tính, Chuyển PDF sang Excel là công cụ tốt hơn.
Nên biết: Font được thay thế: file .docx dùng font Bangla Unicode chứ không phải font của PDF, nên trông gần giống chứ không giống hệt. PDF chữ dùng font Bijoy chuyển ra thành các phím gõ Bijoy và cần đi qua Chuyển Bijoy sang Unicode sau đó. OCR bỏ qua ảnh chụp và logo, giữ chữ viết tay ở dạng hình ảnh, và mất vài giây cho mỗi trang, vì chính thiết bị của bạn thực hiện việc đọc.
Đặt công cụ này lên website của bạn
Miễn phí cho mọi blog, trang lớp học hay bài viết hướng dẫn. Chỉ cần dán một đoạn mã là khách truy cập có thể dùng ngay trên trang của bạn.
Công cụ liên quan
Chuyển PDF sang Word
Chuyển thành .docx chỉnh sửa được, có OCR cho bản scan
OCR tiếng Bengal
Đọc chữ tiếng Bengal từ ảnh hoặc bản scan
Chuyển Bijoy sang Unicode
Đọc văn bản SutonnyMJ thành tiếng Bengal thực sự
Chuyển PDF sang văn bản
Văn bản thuần để sao chép và chỉnh sửa
Chuyển PDF sang Excel
Bảng biểu thành bảng tính thực sự
Chuyển PDF sang PowerPoint
Slide chỉnh sửa được từ mọi PDF