Chuyển PDF sang văn bản
Lấy chữ ra khỏi PDF mà vẫn giữ nguyên dòng và đoạn văn — sao chép thẳng vào bộ nhớ tạm hoặc tải xuống file .txt. Không lưu trữ gì cả.
- Không bao giờ lưu trữ
- Không xếp hàng, không phải chờ
- Không cần đăng ký, không watermark
Cách hoạt động
Thêm file PDF
Thả file PDF vào trang. Quá trình trích xuất bắt đầu ngay, lần lượt từng trang.
Xem và chỉnh
Văn bản hiện trong một ô chỉnh sửa được. Bật hoặc tắt dấu ngắt trang, và sửa bất cứ chỗ nào trước khi lưu.
Sao chép hoặc tải xuống
Sao chép toàn bộ vào bộ nhớ tạm, hoặc tải xuống dưới dạng file .txt.
Chữ đến từ đâu, và theo thứ tự nào
Các ký tự trong PDF không được lưu dưới dạng văn bản. Chúng được lưu dưới dạng số hiệu glyph trỏ vào một phông chữ nhúng, và việc chuyển chúng trở lại thành chữ cái phụ thuộc vào một bảng bên trong file cho biết mỗi glyph tương ứng với ký tự nào. Hầu hết phần mềm tạo PDF đều ghi bảng này. Khi thiếu nó — thủ phạm thường gặp là các bộ phông chữ rút gọn do một số phần mềm thiết kế tạo ra — trang hiển thị hoàn hảo trên màn hình nhưng trích xuất ra toàn ký tự vô nghĩa, vì thông tin cần để đọc nó chưa bao giờ được ghi lại. Không công cụ trích xuất nào sửa được điều đó; đây là dữ liệu bị thiếu chứ không phải một bài toán khó.
Thứ tự đọc là điều cần kiểm tra trước khi tin vào kết quả. Văn bản ra theo thứ tự trang vẽ nó, tức là thứ tự mà phần mềm tạo PDF tình cờ xuất ra — và thứ tự đó thường không phải thứ tự con người đọc. Một trang hai cột thường được trích xuất thành cột trái và cột phải tách bạch đúng cách, hoặc thành các dòng xen kẽ giữa hai cột, hoàn toàn tùy vào cách file được tạo. Tiêu đề trang, chân trang, số trang và thanh bên nằm ở bất cứ chỗ nào chúng được vẽ, thường là ngay giữa phần nội dung.
Có vài lỗi nhỏ đáng để nhận ra thay vì băn khoăn. Chữ ghép (ligature) ra thành đúng một ký tự mà phông chữ đã dùng, nên “find” có thể đến dưới dạng một glyph thay vì f rồi i, và tìm kiếm đơn giản chữ “find” sẽ bỏ sót nó. Từ bị gạch nối ở chỗ xuống dòng vẫn giữ dấu gạch nối, vì chỗ ngắt đó có thật trong file. Và dấu nháy thẳng thường là dấu nháy cong, điều này quan trọng nếu văn bản sẽ được đưa vào code hoặc file CSV.
Trang scan không cho ra gì cả, và công cụ báo rõ điều đó thay vì trả về một file rỗng — ảnh chụp tài liệu không có ký tự nào, chỉ có pixel. Điều tương tự cũng đúng với chữ đã chuyển thành đường viền, việc mà nhà thiết kế cố ý làm để file in ra giống hệt nhau ở mọi nơi; lúc đó nó thực sự đã là hình vẽ. Cả hai trường hợp đều cần OCR chứ không phải trích xuất.
Khi bạn cần công cụ khác
Khi các cột quan trọng, lệnh pdftotext -layout in.pdf out.txt của Poppler làm tốt hơn mọi thứ trình duyệt làm được: nó dựng lại khoảng cách hiển thị bằng khoảng trắng thật, nên cột vẫn là cột và bảng vẫn là bảng đọc được. pdftotext -raw đi theo hướng ngược lại, giữ nguyên thứ tự vẽ, đôi khi đúng là thứ một script cần.
Để lấy văn bản từ hàng trăm file, mutool draw -F txt và thư viện pdfplumber của Python là nền tảng nên dùng — đặc biệt pdfplumber trả về từng ký tự kèm tọa độ, phông chữ và cỡ chữ, nên bạn có thể lọc bỏ tiêu đề trang và chân trang theo vị trí thay vì phỏng đoán. Đó là việc trang này không làm được, và là việc quan trọng khi xử lý số lượng lớn.
Câu hỏi thường gặp
Công cụ có giữ đoạn văn và dấu xuống dòng không?
Có. PDF hoàn toàn không lưu đoạn văn — chỉ có các ký tự tại những tọa độ — nên văn bản được dựng lại bằng cách gom các từ nằm chung một đường cơ sở và bắt đầu đoạn mới ở chỗ khoảng cách dọc giãn rộng ra. Kết quả đọc giống bản gốc chứ không phải một khối chữ liền mạch.
File PDF của tôi có bị lưu ở đâu không?
Không. Văn bản được chính trình duyệt của bạn đọc và không bao giờ bị gửi đi đâu. Bạn có thể ngắt kết nối internet sau khi trang tải xong mà công cụ vẫn chạy.
Công cụ báo PDF của tôi không có văn bản — tại sao?
Vì đó là bản scan hoặc ảnh chụp: trang giấy là một hình ảnh, và hình ảnh thì không có chữ để trích xuất. Hãy dùng OCR PDF, công cụ đọc chữ ngay từ hình ảnh.
Tôi có thể sửa văn bản trước khi tải xuống không?
Có — ô văn bản chỉnh sửa được hoàn toàn, và những gì bạn thấy chính xác là những gì được lưu.
Còn bảng và văn bản nhiều cột thì sao?
Các cột được đọc theo thứ tự PDF vẽ chúng, thường là đúng nhưng có thể xen kẽ lẫn nhau ở bố cục nhiều cột phức tạp. Bảng ra thành các dòng chữ chứ không phải dạng lưới — với bảng, hãy dùng Chuyển PDF sang Excel.
Nên biết: Văn bản thuần không mang định dạng: chữ đậm, cỡ chữ, màu sắc, hình ảnh và cấu trúc bảng đều bị bỏ đi, vốn dĩ là như vậy. Chữ được vẽ thành đường viền vector thay vì ký tự thật (thường gặp ở logo và một số PDF thiết kế) thì không công cụ nào trích xuất được nếu không có OCR.
Đặt công cụ này lên website của bạn
Miễn phí cho mọi blog, trang lớp học hay bài viết hướng dẫn. Chỉ cần dán một đoạn mã là khách truy cập có thể dùng ngay trên trang của bạn.
Công cụ PDF khác
Chuyển PDF sang Word
Chuyển thành .docx chỉnh sửa được, có OCR cho bản scan
OCR PDF
Biến bản scan thành PDF tìm kiếm được
Chuyển TXT sang PDF
Văn bản hoặc ghi chú thành PDF gọn gàng
Chuyển PDF sang HTML
Một trang web độc lập, đầy đủ
Chuyển PDF sang PDF/A
Định dạng lưu trữ dài hạn
Chuyển PDF sang Excel
Bảng biểu thành bảng tính thực sự