Chuyển đến nội dung

Biến PDF scan thành PDF tìm kiếm được

Đọc chữ từ bản scan và đặt chúng một cách vô hình lên các trang. Tài liệu trông vẫn như cũ — chỉ là giờ đây tìm kiếm, bôi chọn và sao chép được. Các trang scan bị lệch hoặc nằm ngang sẽ được xoay thẳng lại.

  • Không bao giờ lưu trữ
  • Không xếp hàng, không phải chờ
  • Không cần đăng ký, không watermark

Cách hoạt động

1

Thêm file PDF scan

Thả file vào. Công cụ kiểm tra xem file đã có lớp văn bản chưa và báo cho bạn nếu OCR sẽ làm kết quả tệ đi.

2

Kiểm tra ngôn ngữ

Công cụ đọc trang đầu tiên và cho bạn biết đã nhận ra ngôn ngữ nào. Có hơn 120 ngôn ngữ nếu bạn cần tự chọn.

3

Tải xuống

Bạn nhận được đúng tài liệu cũ, giờ có thêm một lớp văn bản ẩn phía sau bản scan.

Một lớp vô hình trên trang không thay đổi

Bản scan được giữ nguyên đúng như cũ. Thứ được thêm vào là một lớp chữ vẽ ở chế độ hiển thị vô hình — ký tự thật, đặt từng từ một lên đúng các từ trong ảnh, được đánh dấu để không bao giờ được tô màu. Trang trông giống hệt vì về mặt hình ảnh không có gì thay đổi; bôi chọn một câu, vùng tô sáng rơi đúng vào các từ vì chữ vô hình nằm đúng chỗ mực hiện ra. Đây là cách chuẩn để tạo một bản scan tìm kiếm được, và đó là lý do kết quả có thể tìm kiếm, sao chép và lập chỉ mục trong khi vẫn là một bức ảnh chụp tài liệu.

Có hai điều về trang được cố ý chỉnh lại, vì việc đọc vốn đã cần đến chúng. Trang bị scan nằm ngang được xoay thẳng đứng, và trang bị kéo lệch qua khay nạp giấy được chỉnh thẳng — nên kết quả thường gọn gàng hơn bản gốc. Kích thước trang được giữ theo file PDF gốc chứ không bị đồng bộ hóa, nên tài liệu có nhiều khổ trang khác nhau vẫn giữ nguyên như vậy và không có gì bị thu phóng.

Độ chính xác gần như phụ thuộc hoàn toàn vào bản scan, và chênh lệch là rất lớn. Một bản scan chữ in 300 DPI rõ nét cho độ chính xác rất cao; cùng trang đó ở 150 DPI đọc kém đi rõ rệt; một bức ảnh chụp nghiêng trong điều kiện thiếu sáng lại là chuyện hoàn toàn khác. Nếu bạn tự scan, 300 DPI thang xám là thiết lập quan trọng — độ phân giải cao hơn thế hiếm khi giúp ích, còn thấp hơn là kém đi ngay. Chữ nhỏ, dòng sát nhau, nền màu, bản photo của bản photo và mọi thứ đóng dấu hay viết tay đều khó hơn theo những cách mà chưa phần mềm nào giải quyết trọn vẹn.

Những gì cố ý bị bỏ ra cũng quan trọng như những gì được đưa vào. Ảnh chụp, logo, chữ ký và hình trang trí bị bỏ qua thay vì được đọc, vì ép ra chữ cái từ một bức ảnh sẽ tạo ra những chuỗi vô nghĩa trông như thật rồi xuất hiện trong mọi lần tìm kiếm. Các chữ tiếng Trung, tiếng Nhật và tiếng Hàn được nhận dạng nhưng bị bỏ ra khỏi lớp văn bản và được đếm lại cho bạn, thay vì ghi thành khoảng trống, cho đến khi có phông chữ chứa được chúng. Không có gì ở đây sắp chữ lại tài liệu: các chữ trên trang vẫn là một bức ảnh, và chuyển sang Word mới là công cụ để biến chúng thành văn bản chỉnh sửa được.

Khi bạn cần công cụ khác

OCRmyPDF là công cụ mà trang này chỉ là phương án tiện lợi đi kèm, và nó miễn phí. ocrmypdf --deskew --rotate-pages in.pdf out.pdf làm cùng việc với nhiều quyền kiểm soát hơn, thêm --optimize 3 để thu nhỏ kết quả, --redo-ocr để thay một lớp văn bản sẵn có bị lỗi, và --output-type pdfa để tạo file lưu trữ ngay trong cùng một lượt. Nó xử lý được hàng nghìn trang, chạy được trong trình theo dõi thư mục, và là thứ mà các thư viện và kho lưu trữ tài liệu thực sự dùng.

Với tài liệu khó — bản in cổ, bố cục lạ, bảng biểu dày đặc — dịch vụ đám mây của Google, Amazon hoặc Microsoft sẽ đọc được những trang mà nhận dạng đa dụng không đọc nổi, vì chúng được huấn luyện trên lượng dữ liệu lớn hơn nhiều. Đó là khác biệt thực sự về năng lực và đáng để biết. Nhưng nó cũng đồng nghĩa với việc gửi tài liệu của bạn cho bên thứ ba, đúng sự đánh đổi mà trang này được tạo ra để tránh — nên đó là lựa chọn đúng cho một cuốn sách cũ dễ rách, và là lựa chọn sai cho một thùng hồ sơ y tế.

Câu hỏi thường gặp

Các trang có trông khác đi sau khi xử lý không?

Chỉ thẳng hơn thôi: trang bị scan lệch một độ hoặc nằm ngang sẽ được dựng thẳng lại. Bản scan được giữ nguyên, và các chữ nhận dạng được đặt lên trên bằng mực vô hình — không bao giờ được tô màu, không bao giờ được in ra. Điều thay đổi là Ctrl+F bắt đầu tìm thấy nội dung.

Tài liệu của tôi có bị lưu trữ ở đâu không?

Không. Quá trình nhận dạng không lưu trữ gì cả. Bộ đọc và gói ngôn ngữ được tải từ trang web này vào lần đầu bạn dùng một ngôn ngữ; bản thân tài liệu không bao giờ rời khỏi thiết bị.

Độ chính xác thế nào?

Với bản scan rõ nét của chữ in, rất cao. Ảnh chụp mờ, chữ viết tay và phông chữ lạ làm giảm độ chính xác; độ lệch được chỉnh trước khi đọc. Bảng có kẻ ô được đọc từng ô một, nên nhãn biểu mẫu không bị dính vào giá trị của chúng.

Những ngôn ngữ nào dùng được?

Hơn 120, gồm tiếng Anh, tiếng Bengal, tiếng Hindi, tiếng Urdu, tiếng Ả Rập, tiếng Tây Ban Nha, tiếng Pháp, tiếng Trung, tiếng Nhật và tiếng Hàn. Hệ chữ được nhận diện từ trang; khi nhiều ngôn ngữ dùng chung một hệ chữ, ngôn ngữ của trình duyệt sẽ được dùng để phân định và bạn có thể thay đổi.

Một số chữ bị thiếu trong lớp văn bản. Vì sao?

Lớp văn bản chỉ chứa được những ký tự mà một phông chữ đi kèm viết được. Chữ Bengal, Devanagari, Ả Rập, Thái và hai chục hệ chữ khác có phông riêng ở đây; tiếng Trung, tiếng Nhật và tiếng Hàn thì chưa, nên các chữ đó được đếm lại cho bạn thay vì lưu thành khoảng trống. Chuyển PDF sang Word có OCR sẽ cho bạn đầy đủ phần văn bản đó.

Mất bao lâu?

Vài giây mỗi trang, vì chính thiết bị của bạn đang đọc chứ không phải một cụm máy chủ. Tiến độ được hiển thị theo từng trang.

Nên biết: Các chữ tiếng Trung, tiếng Nhật và tiếng Hàn bị bỏ ra khỏi lớp văn bản và được đếm lại cho bạn, thay vì lưu thành khoảng trống, cho đến khi có phông chữ cho chúng; mọi hệ chữ khác mà bộ đọc biết đều được ghi. Ảnh, logo và chữ ký bị bỏ qua để chúng không bao giờ biến thành chữ vô nghĩa. Chữ viết tay không được nhận dạng đáng tin cậy bởi bất kỳ công cụ OCR đa dụng nào.

Đặt công cụ này lên website của bạn

Miễn phí cho mọi blog, trang lớp học hay bài viết hướng dẫn. Chỉ cần dán một đoạn mã là khách truy cập có thể dùng ngay trên trang của bạn.