Chuyển đến nội dung

Lấy chữ từ hình ảnh

Đọc chữ từ ảnh chụp, bản scan hoặc ảnh chụp màn hình và lấy về dưới dạng văn bản để chỉnh sửa, tìm kiếm và dán. Ảnh không bao giờ bị lưu trữ.

  • Không bao giờ lưu trữ
  • Không xếp hàng, không phải chờ
  • Không cần đăng ký, không watermark

Cách hoạt động

1

Thêm ảnh của bạn

JPG, PNG, WebP, GIF, BMP, ảnh HEIC từ iPhone hoặc file TIFF từ máy scan. Ảnh chụp nghiêng được làm thẳng và cân bằng ánh sáng trước khi đọc.

2

Kiểm tra ngôn ngữ

Hệ chữ được nhận ra từ chính bức ảnh và ngôn ngữ được chọn sẵn cho bạn. Có hơn 120 ngôn ngữ để chọn nếu đoán sai, hoặc nếu ảnh có nhiều ngôn ngữ.

3

Sao chép hoặc tải xuống

Giữ nguyên bố cục, với các dòng và cột ở đúng vị trí, hoặc nối các dòng thành đoạn văn liền mạch để dán vào nơi khác.

Bức ảnh được đọc như thế nào

Kích thước lý tưởng được đo từ nét chữ chứ không phải từ file. Chiều cao một dòng chữ được ước tính từ chính bức ảnh và mọi thứ được co giãn để mỗi dòng cao khoảng ba mươi tư pixel — ảnh chụp màn hình nhỏ được phóng to tới bốn lần, còn ảnh chụp khổng lồ được thu nhỏ, và cạnh dài nhất luôn có giới hạn. Vì vậy một bức ảnh chín megapixel chụp thực đơn không chính xác hơn một ảnh nhỏ sắc nét, và một ảnh có cạnh ngắn dưới khoảng ba trăm pixel sẽ bỏ qua hoàn toàn bước nhận diện ngôn ngữ và được đọc như chữ Latin. Trước tất cả những bước đó, nền giấy phía sau nét chữ được ước tính theo từng vùng và loại bỏ để cân bằng ánh sáng, độ nghiêng của trang được đo trên toàn bộ chiều cao và xoay cho thẳng, rồi kết quả được chuyển thành đen trắng theo một ngưỡng chung duy nhất.

Chọn ngôn ngữ là một vòng thử giọng chứ không phải tra cứu, vì bộ nhận diện thông thường thực ra không nhận diện ngôn ngữ. Lượt đầu chỉ báo hệ chữ và góc xoay, không gì hơn; hệ chữ thu hẹp phạm vi, cài đặt ngôn ngữ trong trình duyệt của bạn phân định giữa các ngôn ngữ dùng chung hệ chữ, rồi từng ứng viên được dùng thật để đọc một bản thu nhỏ của bức ảnh và được chấm điểm theo số từ nó đọc ra một cách chắc chắn. Ứng viên thắng sẽ đọc trang thật, và văn bản nhận được lại được kiểm tra — về dấu phụ, các cặp chữ đặc trưng, các từ ngắn thông dụng — xem một ngôn ngữ khác có cho kết quả tốt hơn không. Đây là cơ chế đằng sau câu “chọn sai ngôn ngữ sẽ cho bạn một trang trống đầy tự tin”: vòng thử giọng tồn tại chính là để phỏng đoán được kiểm chứng trên bức ảnh của bạn thay vì chỉ được khẳng định.

Có một điều nên biết về những gì xuất hiện trong kết quả. Đoạn văn mà công cụ không chắc chắn sẽ bị bỏ đi thay vì hiển thị, nên chữ bạn nhìn thấy trong ảnh có thể vắng mặt hoàn toàn trong kết quả thay vì hiện ra dưới dạng ký tự vô nghĩa. Điều tương tự áp dụng cho các khối bị xếp loại là hình ảnh hoặc nhiễu, và các dấu lẻ tẻ không chứa chữ cái hay chữ số nào. Không có ngưỡng loại bỏ nào cho từng từ có độ tin cậy thấp, nên lỗi đọc bên trong một đoạn vẫn còn đó và bạn cần tự phát hiện. Khi chỉ số độ tin cậy khá ổn mà một phần của trang đơn giản là không có, thì đó là điều đã xảy ra.

Khi bạn cần công cụ khác

Không lưu trữ gì cả, nhưng đây là công cụ duy nhất trên trang mà lần chạy đầu tiên không nhẹ nhàng: bản thân bộ đọc nặng vài megabyte và mỗi gói ngôn ngữ thêm từ một đến năm megabyte, được tải từ trang này rồi giữ lại cho lần sau. Một trang thì đáng để chờ, còn hai nghìn bản scan chạy theo lịch thì không — đó là việc của công cụ OCR trên máy tính như OCRmyPDF, thêm lớp văn bản cho cả thư mục chỉ bằng một lệnh, không phải tải gì và không phải bấm gì.

Có ba việc công cụ này đơn giản là không làm, và biết trước sẽ nhanh hơn tự phát hiện ra. Phối cảnh không được chỉnh — trang được đo góc xoay và làm thẳng, nhưng ảnh chụp từ một bên vẫn giữ hình thang, nên chụp thẳng từ trên xuống đáng bỏ thêm một giây. Ngưỡng tách nét chữ khỏi nền giấy là một giá trị duy nhất cho cả bức ảnh thay vì riêng cho từng vùng, nên một trang có nửa nằm trong bóng tối sẽ mất phần tối ngay cả sau khi cân bằng ánh sáng; hãy chụp lại dưới ánh sáng đều thay vì cố xoay xở. Và một bảng được căn bằng khoảng trắng thay vì đường kẻ thì không có đường kẻ nào để tìm, nên được đọc như các cột văn bản và dán vào bảng tính mà vẫn đúng chỉ là nhờ may mắn.

Câu hỏi thường gặp

Độ chính xác như thế nào?

Với chữ in rõ ràng, chụp thẳng và lấy nét tốt thì rất cao — chỉ sai vài ký tự trên một nghìn. Độ chính xác giảm khi ảnh mờ, bị lóa, tương phản thấp hoặc kiểu chữ lạ, và trang sẽ cho bạn biết công cụ chắc chắn đến mức nào thay vì để bạn phải đoán. Nếu con số thấp thì thường là do bức ảnh: thêm ánh sáng, chụp ít nghiêng hơn và để chữ lấp đầy khung hình sẽ khắc phục phần lớn.

Ảnh của tôi có bị lưu trữ ở đâu không?

Không. Gói ngôn ngữ được tải từ trang này lần đầu bạn dùng một ngôn ngữ; bản thân bức ảnh không bao giờ bị lưu trữ và không bao giờ được gửi đi đâu, nên công cụ vẫn chạy khi tắt Wi-Fi.

Công cụ đọc được những ngôn ngữ nào?

Hơn 120 ngôn ngữ, bao gồm tiếng Anh, tiếng Bengal, tiếng Hindi, tiếng Urdu, tiếng Ả Rập, tiếng Tây Ban Nha, tiếng Pháp, tiếng Đức, tiếng Bồ Đào Nha, tiếng Nga, tiếng Trung, tiếng Nhật và tiếng Hàn. Hệ chữ được nhận ra từ chính bức ảnh; khi nhiều ngôn ngữ dùng chung một hệ chữ — Latin, Kirin, Ả Rập, Devanagari — ngôn ngữ cài đặt trong trình duyệt của bạn sẽ quyết định, và bạn luôn có thể đổi lại.

Công cụ có giữ được các cột và bảng không?

Có, nếu bạn yêu cầu. Bảng có đường kẻ được nhận ra và đọc từng ô, nên nhãn không bị dính vào giá trị, và kết quả trả về dạng các hàng phân tách bằng tab, dán thẳng vào bảng tính được. Văn bản chia cột được đọc theo thứ tự đọc thay vì đọc ngang qua các cột. Nếu chọn nối các dòng thì cấu trúc đó bị bỏ đi có chủ đích, đúng thứ bạn cần cho một đoạn văn sắp được dàn lại.

Công cụ có đọc được chữ viết tay không?

Chữ in viết tay gọn gàng, tách rời — như chữ in hoa trên biểu mẫu — thường đọc được. Chữ viết tay liền nét thì không, ở đây hay bất kỳ công cụ OCR thông thường nào khác; nói thẳng ra, đó là một bài toán khác, cần một cách tiếp cận khác. Có một trang riêng cho chữ viết tay nói rõ điều này và cho bạn thấy công cụ đọc được đến đâu.

Hỗ trợ những định dạng ảnh nào?

JPG, PNG, WebP, GIF, BMP và SVG qua chính trình duyệt, cùng với HEIC từ iPhone và TIFF từ máy scan. Ảnh chụp dọc bằng điện thoại hiển thị đúng chiều, vì thông tin hướng xoay do máy ảnh ghi lại được áp dụng trước tiên.

Vì sao công cụ đọc sai một số từ?

Hầu như luôn là do bức ảnh chứ không phải do chữ: vệt lóa trên trang, bóng tay bạn, máy rung khi chụp, hoặc chữ trên màn hình nhỏ đến mức mỗi ký tự chỉ có vài pixel. Ảnh được co giãn về kích thước dễ đọc nhất và cân bằng ánh sáng trước, nhưng không cách xử lý nào tạo ra được chi tiết mà máy ảnh không ghi lại.

Có giới hạn dung lượng không?

Chỉ có giới hạn bộ nhớ của chính thiết bị bạn. Không lưu trữ gì cả, nên không có giới hạn nào từ máy chủ. Ảnh chụp rất lớn sẽ được thu nhỏ về mức công cụ đọc dùng được — vượt quá mức đó, thêm pixel chỉ tốn thêm tài nguyên mà không chính xác hơn.

Nên biết: Không công cụ OCR thông thường nào, kể cả công cụ này, nhận dạng đáng tin cậy chữ viết tay liền nét. Chữ in đè lên hình ảnh, chữ cách điệu mạnh và độ tương phản rất thấp sẽ cho kết quả chắp vá. Kết quả là văn bản thuần: kiểu chữ, màu sắc, in đậm và in nghiêng không được giữ lại, bản thân bức ảnh cũng vậy.

Đặt công cụ này lên website của bạn

Miễn phí cho mọi blog, trang lớp học hay bài viết hướng dẫn. Chỉ cần dán một đoạn mã là khách truy cập có thể dùng ngay trên trang của bạn.