Chuyển đến nội dung

Vì sao không tìm kiếm được trong file PDF scan

Vì trong đó không có chữ nào cả. Hiểu được file thực sự chứa gì sẽ giải thích mọi triệu chứng, và chỉ ra cài đặt duy nhất quyết định việc khắc phục tốt đến đâu.

Xem xét lần cuối

Trong file không có chữ nào

Một file PDF có thể chứa hai thứ hoàn toàn khác nhau nhưng trông giống hệt nhau trên màn hình. Tài liệu xuất từ Word chứa văn bản — các ký tự thực sự, mỗi ký tự có vị trí và phông chữ — vì vậy bạn có thể chọn một câu, tìm một cái tên và sao chép một đoạn văn. Tài liệu scan chứa một bức ảnh chụp trang giấy. Trong đó chẳng có gì ngoài điểm ảnh, giống hệt như một bức ảnh chụp biển báo đường chỉ có điểm ảnh mà thôi.

Mọi triệu chứng đều bắt nguồn từ thực tế đó. Tìm kiếm không ra gì vì chẳng có gì để khớp. Chọn chữ không được vì không có chữ để chọn — con trỏ chỉ vẽ một hình chữ nhật lên bức ảnh. Sao chép chẳng được gì. File nặng so với độ dài của nó, vì ảnh thì nặng còn chữ thì không. Và chuyển nó sang Word sẽ cho ra hoặc một tài liệu trống, hoặc một bức ảnh được dán vào tài liệu.

Cách kiểm tra nhanh: thử dùng chuột chọn một từ. Nếu con trỏ chuyển thành dạng nhập chữ và từ đó được tô sáng, file có chữ thật. Nếu bạn chỉ kéo ra một khung, đó là hình ảnh.

OCR thực sự bổ sung những gì

Nhận dạng ký tự quang học đọc các hình dạng trong bức ảnh và xác định đó là những chữ cái nào. Phần hữu ích là bước tiếp theo: các từ được nhận dạng sẽ được ghi ngược vào file PDF dưới dạng chữ ẩn, đặt ngay trên các từ trong ảnh. Trang trông y hệt như trước, vì về mặt hình ảnh chẳng có gì thay đổi — nhưng giờ đây nó có thể được tìm kiếm, chọn, sao chép và lập chỉ mục.

Đó là một thiết kế cố ý thận trọng và là thiết kế đúng cho tài liệu. Không có gì được dàn trang lại, nên một bản hợp đồng vẫn trông đúng như bản đã được ký, và bản scan gốc vẫn là bản lưu hình ảnh. Biến PDF scan thành file tìm kiếm được làm việc này trong một lần, và thường làm thẳng và xoay đúng chiều các trang luôn, vì việc đọc vốn cũng cần như vậy.

Nếu bạn cần một tài liệu chỉnh sửa được thay vì chỉ tìm kiếm được, đó là một việc khác và khó hơn nhiều: chữ phải được trích xuất, bố cục phải được suy ra, và kết quả phải được dựng lại thành đoạn văn và bảng. Chuyển sang Word làm việc đó, và kết quả luôn cần được kiểm tra lại theo cách mà một lớp văn bản ẩn không cần.

Cài đặt quyết định tất cả: 300 DPI

Độ chính xác nhận dạng phụ thuộc vào bản scan nhiều hơn hẳn so với phần mềm, và con số quan trọng nhất là độ phân giải. 300 DPI là tiêu chuẩn, và không phải là con số tùy tiện — nó cho khoảng 30 điểm ảnh chiều cao với cỡ chữ nội dung thông thường, dư sức vượt mức tối thiểu cần để phân biệt những chữ cái có hình dạng giống nhau.

Ở 150 DPI, độ chính xác giảm rõ rệt, và các lỗi thuộc loại khó phát hiện: số 1 bị đọc thành chữ l, số 5 thành chữ S, rn thành m. Thấp hơn nữa thì chất lượng giảm rất nhanh. Tăng trên 300 hiếm khi có ích mà còn làm file nặng hơn nhiều — 600 DPI chỉ đáng dùng cho chữ rất nhỏ hoặc bản gốc kém chất lượng.

Ba cài đặt chụp khác cũng quan trọng gần như vậy. Thang xám thay vì trắng đen, vì ngưỡng cắt cứng sẽ phá hủy những nét mảnh của chữ. Phẳng và vuông góc với cảm biến, vì trang giấy chụp nghiêng sẽ có chữ bị biến dạng dần trên trang. Và ánh sáng đều — lỗi kinh điển là bóng của chính bạn đổ lên trang giấy khi bạn chụp từ trên xuống.

Những gì không OCR nào đọc được

Nói thẳng điều này sẽ tiết kiệm rất nhiều thời gian. Chữ viết tay liền nét không được nhận dạng bởi các công cụ OCR thông thường, và lý do nằm ở cấu trúc chứ không phải ở nỗ lực: đọc chữ in dựa vào việc tìm ranh giới giữa các chữ cái, còn chữ viết liền thì không có ranh giới nào. Chữ in viết tay, chữ in hoa và ô trong biểu mẫu thường cho kết quả tốt, vì đó là những hình dạng tách rời có khoảng cách giữa chúng.

Chữ nằm trong ảnh chụp — chữ trên biển hiệu, trên sản phẩm, trên nền rối mắt — khó hơn nhiều so với chữ trên giấy, và chữ cách điệu hay trang trí nhiều còn khó hơn nữa. Bản photocopy của bản photocopy mất đi những nét mảnh giúp phân biệt các chữ cái. Và tài liệu bị đóng dấu, ghi chú hay tô sáng sẽ khó đọc hơn ở những chỗ các dấu đó đè lên chữ.

Một công cụ tốt sẽ cho bạn biết mức độ tin cậy của nó, và con số đó có là để dùng. Độ tin cậy thấp ở giữa một câu bạn có thể đọc ra từ ngữ cảnh ít quan trọng hơn nhiều so với độ tin cậy thấp ở một chữ số trong số tài khoản. Lỗi nguy hiểm nhất là những lỗi có độ tin cậy cao, vì không có gì đánh dấu chúng.

Vì sao điều này quan trọng hơn cả sự tiện lợi

Một kho lưu trữ scan không có lớp văn bản, trên thực tế, coi như đã mất. Không gì tìm kiếm được trong đó, không gì lập chỉ mục được, không hệ thống tuân thủ nào tìm được một cái tên trong đó, và không trình đọc màn hình nào đọc to được nó — điều này ở nhiều nơi khiến việc công bố nó trở thành vấn đề pháp lý chứ không chỉ là bất tiện.

Đó cũng là lý do nên kiên quyết scan đúng cài đặt ngay từ lần đầu. Scan lại cả một thùng tài liệu tốn kém hơn nhiều so với scan đúng cách một lần, và không có cách xử lý nào khôi phục được chi tiết chưa từng được ghi lại.

Câu hỏi thường gặp

OCR thực sự chính xác đến đâu?

Với bản scan 300 DPI sạch sẽ của chữ in thông thường thì rất chính xác — đủ cao để lỗi chỉ thỉnh thoảng xuất hiện chứ không phải thường xuyên. Với ảnh chụp bằng điện thoại ở góc nghiêng và thiếu sáng thì kém hơn rất nhiều. Chất lượng bản scan quan trọng hơn nhiều so với việc chọn phần mềm nào.

OCR có làm thay đổi giao diện tài liệu của tôi không?

Không. Chữ được nhận dạng được thêm vào dưới dạng ẩn, nằm trên ảnh có sẵn, nên trang trông y hệt như trước. Các trang thường được làm thẳng và xoay đúng chiều trong quá trình xử lý, giúp những bản scan bị lệch trông đẹp hơn chứ không phải khác đi.

Tôi có thể chỉnh sửa chữ sau khi chạy OCR không?

Không phải ngay trong file PDF — trang bạn thấy vẫn là một bức ảnh, và lớp văn bản nằm ẩn phía trên nó. Để có bản chỉnh sửa được, hãy chuyển tài liệu đã nhận dạng sang Word, và nên kiểm tra lại kết quả.

OCR có đọc được chữ viết tay không?

Chữ in viết tay tách rời và biểu mẫu đã điền thường đọc được. Chữ viết liền thì không, với bất kỳ công cụ OCR thông thường nào — các chữ cái dính vào nhau, không có ranh giới để tìm. Những công cụ được huấn luyện riêng cho chữ viết tay làm tốt hơn, nhưng phải gửi các trang của bạn cho bên thứ ba.

Vì sao file PDF tìm kiếm được lại nặng hơn nhiều như vậy?

Lẽ ra dung lượng hầu như không đổi — lớp văn bản chỉ vài kilobyte mỗi trang. Nếu file tăng nhiều, có lẽ các trang đã bị kết xuất lại thay vì được giữ nguyên, điều này đáng kiểm tra, vì mục đích của lớp văn bản là giữ nguyên hoàn toàn ảnh gốc.