Chuyển đến nội dung

Đọc chữ Bangla từ hình ảnh

Đưa vào một ảnh chụp trang giấy, bản scan hoặc ảnh chụp màn hình và nhận lại chữ tiếng Bengal dưới dạng Unicode — tìm kiếm được, chỉnh sửa được và sẵn sàng để dán. Bộ đọc đã được đặt sang Bangla trước khi ảnh đến, nên không có gì phải nhận diện và không có gì phải chọn. Ảnh của bạn không bao giờ bị lưu trữ.

  • Không bao giờ lưu trữ
  • Không xếp hàng, không phải chờ
  • Không cần đăng ký, không watermark

Cách hoạt động

1

Thêm ảnh

Ảnh chụp một trang sách, một công văn cũ, một chứng chỉ scan hay ảnh chụp màn hình chữ Bangla. JPG, PNG, WebP, HEIC và TIFF đều dùng được; ảnh chụp nghiêng được làm thẳng trước.

2

Để công cụ đọc

Tiếng Bengal đã được chọn sẵn. Nếu trang có cả tiếng Anh — một biểu mẫu, một tiêu đề thư — hãy thêm từ danh sách và cả hai đều được đọc.

3

Sao chép dưới dạng Unicode

Chữ ra ở dạng Unicode, bất kể bản gốc in bằng font nào: một công văn SutonnyMJ đọc ra thành chữ Bangla bình thường chứ không phải "evsjv‡`k". Giữ bố cục hoặc nối các dòng, rồi sao chép hoặc tải xuống.

Bangla ảnh hưởng thế nào đến việc đọc

Mô hình tiếng Bengal đọc theo cụm chứ không theo từng chữ cái. Một chữ ghép như ক্ষ hay ন্ত্র là một hình duy nhất trên trang, và mô hình phải quyết định cả nó là gì và nó tách thành Unicode như thế nào — vì vậy một lỗi đọc trong tiếng Bangla thường cho ra một chữ ghép sai hoặc một dấu nguyên âm đặt nhầm chữ cái, chứ không phải sai hẳn một chữ cái. Kết quả ra theo thứ tự Unicode mong đợi: dấu nguyên âm đứng sau cụm phụ âm của nó, reph được viết là র + hasanta trước cụm mà nó nằm trên, và nguyên âm hai phần ra thành một mã ký tự duy nhất. Đó là thứ tự mà mọi ô tìm kiếm, trình kiểm tra chính tả và font đều mong đợi, và ngược với thứ tự hiển thị mà người gõ Bijoy quen dùng.

Mọi việc bộ đọc thông thường làm đều được làm ở đây: cân bằng nền giấy, làm thẳng trang, đọc bảng có đường kẻ theo từng ô để nhãn và giá trị không dính vào nhau, và kết quả trả về hoặc giữ bố cục như trang gốc hoặc nối thành đoạn văn. Số được đọc là chữ số Bengal khi chúng in bằng chữ số Bengal; một biểu mẫu trộn ০১২ với 012 giữ cả hai.

Tiếng Bengal không dùng chung mô hình với ngôn ngữ nào khác, nhưng bức ảnh vẫn có thể chứa tiếng Anh — một tiêu đề thư, một số tham chiếu, một khối chữ ký — và ngôn ngữ này đọc ngôn ngữ kia thành vô nghĩa. Thêm tiếng Anh từ danh sách sẽ đọc trang bằng cả hai gói và giữ mỗi từ ở đúng hệ chữ mà nó được in.

Khi bạn cần công cụ khác

Một tài liệu Bijoy còn tồn tại dưới dạng file thì nên chuyển đổi hơn là chụp ảnh. OCR dựng lại chữ từ pixel và sai vài ký tự trên một nghìn ngay cả với trang tốt nhất; công cụ Chuyển Bijoy sang Unicode dựng lại từ các phím đã gõ và không sai ký tự nào, lại giữ được chữ đậm và bảng. Chỉ chụp trang giấy khi file đã mất.

Với cả một cuốn sách hay một kho bản scan, công cụ trên máy tính mới là hình dạng phù hợp: một công cụ OCR dòng lệnh dùng cùng mô hình tiếng Bengal đọc cả thư mục qua một đêm, và OCRmyPDF thêm lớp văn bản tìm kiếm được cho mọi PDF trong đó. Trang này dành cho trang giấy đang ở trước mặt bạn.

Câu hỏi thường gặp

Ảnh của tôi có bị lưu trữ ở đâu không?

Không. Gói ngôn ngữ được tải từ trang này lần đầu bạn dùng một ngôn ngữ; bản thân bức ảnh không bao giờ bị lưu trữ và không bao giờ được gửi đi đâu, nên công cụ vẫn chạy khi tắt Wi-Fi.

Công cụ đọc tiếng Bengal tốt đến mức nào?

Chữ Bangla in bằng kiểu chữ phổ biến — SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi, một cuốn sách hay một tờ báo — chụp thẳng và rõ nét thì đọc tốt, thỉnh thoảng sai một chữ ghép trên trang bị mờ hoặc phai màu. Lỗi mang đặc trưng của hệ chữ này: một reph hay một dấu nguyên âm trên chữ cái mà mô hình chưa từng thấy ở dạng đó, và những chữ ghép in quá nhỏ. Bản scan rõ ở 300 dpi đọc tốt hơn ảnh điện thoại, và ảnh điện thoại chụp dưới ánh sáng ban ngày đọc tốt hơn ảnh chụp dưới đèn ống.

Có dùng được với tài liệu Bijoy không?

Có, và đó là một trong những cách dùng hay nhất. OCR đọc hình ảnh của chữ chứ không đọc mã ký tự của font, nên một trang gõ bằng SutonnyMJ ra thẳng thành chữ Bangla Unicode — không cần chuyển đổi. Với file Word vẫn còn ở dạng Bijoy (là chữ, không phải ảnh), hãy dùng Chuyển Bijoy sang Unicode, vốn giữ nguyên định dạng và không mắc lỗi đọc nào.

Vì sao Bangla có một trang riêng?

Vì việc nhận diện tốn thời gian và sai với Bangla thường hơn các hệ chữ khác: một trang có tiêu đề thư Latin, một con dấu hay một con số có thể bị đọc như tiếng Anh, và kết quả là cả một trang vô nghĩa đầy tự tin. Đặt ngôn ngữ trước khi ảnh đến nghĩa là gói tiếng Bengal bắt đầu tải ngay khi trang mở ra và bộ đọc không bao giờ thử giọng nhầm ngôn ngữ. Trang Chuyển ảnh sang văn bản thông thường làm cùng việc này với chế độ nhận diện bật, cho ảnh ở bất kỳ ngôn ngữ nào.

Có đọc được chữ viết tay không?

Chữ in viết tay thì thỉnh thoảng; chữ viết tay liền nét thì không, bằng tiếng Bangla hay bất kỳ hệ chữ nào khác — điều này đúng với mọi công cụ OCR thông thường. Trang Nhận dạng chữ viết tay nói rõ điều đó và cho bạn thấy công cụ đọc được đến đâu.

Còn PDF scan thì sao?

Hãy dùng Chuyển PDF tiếng Bengal sang Word cho cả một tài liệu: nó đọc mọi trang theo cùng cách và cho bạn một file .docx. Trang này dành cho một bức ảnh.

Nên biết: Chỉ đọc chữ in: chữ viết tay liền nét không được nhận dạng. Kiểu chữ Bangla trang trí, chữ đè lên ảnh và bản in phai màu nặng cho kết quả chắp vá. Tiếng Assam là một gói riêng — hãy thêm từ danh sách nếu trang viết bằng tiếng Assam. Kết quả là văn bản thuần: chữ đậm, màu sắc và bản thân bức ảnh không được giữ lại.

Đặt công cụ này lên website của bạn

Miễn phí cho mọi blog, trang lớp học hay bài viết hướng dẫn. Chỉ cần dán một đoạn mã là khách truy cập có thể dùng ngay trên trang của bạn.