Cách che thông tin trong PDF đúng cách
Một hình chữ nhật màu đen đè lên chữ không phải là che thông tin. Chữ vẫn nằm trong file, và bất kỳ ai cũng đọc được trong khoảng bốn giây. Đây là cách thực sự hiệu quả, và cách kiểm tra xem nó đã có tác dụng chưa.
Xem xét lần cuối
Sai lầm, và vì sao nó cứ lặp lại
Một trang PDF giống như một chương trình vẽ. Chữ là một lệnh đặt những ký tự cụ thể tại những tọa độ cụ thể, còn một hình chữ nhật đen là một lệnh khác để tô kín một vùng. Vẽ hình chữ nhật không xóa chữ — nó chỉ vẽ đè lên. Các ký tự vẫn nằm trong file, ở bên dưới, và chọn vùng đó sẽ sao chép được chúng ra. Bất kỳ công cụ miễn phí nào cũng trích xuất được chúng trong vài giây.
Lý do sai lầm này cứ lặp lại là giao diện cho bạn thấy như thể đã thành công. Bạn vẽ một ô, chữ biến mất khỏi tầm nhìn, bạn lưu file, và nó trông y hệt một tài liệu đã được che thông tin. Không có lỗi, không có cảnh báo, và không có khác biệt nào nhìn thấy được so với cách che đúng. Mọi vụ che thông tin thất bại từng bị công khai mà bạn đọc được — hồ sơ tòa án chưa được che, số tiền dàn xếp, tên nhân chứng, một bản báo cáo tình báo có phần bị xóa được khôi phục chỉ trong vài phút — đều là do ai đó vẽ một hình và tin vào nó.
Tô sáng chữ bằng màu đen cũng là sai lầm đó dưới một hình thức khác, và phủ một hình chữ nhật trắng lên chữ trong trình soạn thảo văn bản trước khi xuất sang PDF cũng vậy.
Che thông tin thực sự làm gì
Thứ tự được đảo ngược. Chữ bị xóa khỏi nội dung trang trước, rồi ô đen mới được vẽ sau đó như một dấu hiệu cho biết chỗ đó từng có nội dung. Sao chép vùng đã che sẽ chẳng được gì, vì ở đó chẳng có gì; trích xuất chữ của trang thì những từ đó đơn giản là không còn nữa.
Đó là việc mà công cụ Che thông tin PDF ở đây làm, và nó báo cho bạn biết đã xóa bao nhiêu đoạn chữ — điều này quan trọng, vì một lần che không khớp với gì trông giống hệt một lần che thành công. Nếu bạn vẽ một ô lên một cái tên mà không có gì bị xóa, có lẽ cái tên đó là một phần của hình ảnh chứ không phải chữ, và cần đến cách ở phần tiếp theo.
Chữ trong hình ảnh là một vấn đề riêng
Một cái tên nằm trong trang scan, hoặc trong ảnh chụp màn hình được dán vào báo cáo, hoàn toàn không phải là chữ — mà là điểm ảnh. Xóa chữ không động được đến nó, và một ô vẽ đè lên chính là kiểu che phủ vô dụng đã nói ở trên, vì các điểm ảnh bên dưới vẫn còn trong dữ liệu ảnh.
Cách khắc phục là kết xuất lại những trang đó với phần che đã được áp dụng, để các điểm ảnh thực sự không còn tồn tại. Đó là một cái giá thật và bạn nên biết: những trang đó trở thành hình ảnh, nên mọi chữ trên đó không còn chọn được nữa và file nặng hơn. Với tài liệu scan thì không có gì thay đổi, vì nó vốn đã là hình ảnh. Với tài liệu hỗn hợp thì đó là một sự đánh đổi.
Điều tương tự cũng áp dụng cho hình ảnh nói chung. Nếu bạn làm mờ khuôn mặt hoặc biển số xe, hãy làm đủ mạnh để vùng đó không còn cấu trúc nào nhìn thấy được — các nhà nghiên cứu đã từng khôi phục chữ từ vùng làm mờ pixel yếu bằng cách tạo ra các phương án rồi so khớp. Nếu bạn vẫn đoán được ở đó có bao nhiêu ký tự, nghĩa là làm mờ chưa đủ mạnh.
Những nơi PDF còn giữ tên mà bạn quên mất
Đây là phần khiến cả những người đã che thông tin đúng cách cũng mắc bẫy. PDF lưu chữ ở nhiều nơi hơn là trang bạn nhìn thấy, và một lần che hoàn hảo trên trang vẫn để nguyên tất cả những nơi đó.
Cây bookmark thường chứa tiêu đề các mục có tên người trong đó. Giá trị trường biểu mẫu vẫn còn ngay cả khi trường đó không hiển thị. File đính kèm có thể là cả những tài liệu hoàn chỉnh ẩn bên trong PDF. Thông tin tài liệu và gói metadata XMP chứa tiêu đề, tác giả, phần mềm và thường cả đường dẫn file gốc — để lộ tên người dùng và cấu trúc thư mục. Bình luận và chú thích có chữ riêng và tên tác giả của chúng. Và chính tên file cũng đi theo tài liệu đến mọi nơi.
Còn một nơi nữa, và là nơi khó thấy nhất: file PDF được lưu theo kiểu tăng dần sẽ giữ lại các phiên bản trước đó bên trong cùng một file. Nếu tài liệu được chỉnh sửa rồi lưu chứ không được ghi lại từ đầu, một phiên bản trước của trang có thể vẫn còn trong đó. Đây là lý do bước kiểm tra dưới đây là bắt buộc với bất cứ thứ gì quan trọng.
Kiểm tra lại, và kiểm tra thế nào
Kiểm tra là bước mọi người hay bỏ qua và cũng là bước thực sự bảo vệ bạn. Ba cách kiểm tra, theo mức độ kỹ lưỡng tăng dần.
Mở file kết quả và thử chọn vùng đã che. Nếu sao chép được bất cứ thứ gì, hãy dừng lại. Cách này phát hiện lỗi cơ bản trong năm giây và đáng làm mỗi lần.
Xem thuộc tính tài liệu. Tiêu đề, tác giả, chủ đề và từ khóa hiển thị trong mọi trình đọc PDF, ở mục File rồi Properties (Tệp > Thuộc tính). Nếu ô tác giả chính là cái tên bạn vừa mất cả tiếng đồng hồ để xóa, việc che thông tin chẳng đạt được gì.
Dựng lại file. Cho file kết quả chạy qua một công cụ ghi lại tài liệu từ những gì các trang thực sự tham chiếu tới — Ghostscript với gs -sDEVICE=pdfwrite, hoặc qpdf --empty --pages out.pdf 1-z -- — sẽ loại bỏ các đối tượng không được tham chiếu và các phiên bản trước đó. Thêm exiftool -all:all= sẽ xóa sạch metadata. Với hồ sơ nộp tòa hoặc bất cứ thứ gì phải công bố, hãy làm cả ba bước và nhờ người khác kiểm tra lại.
Xóa trang cũng không phải là che thông tin
Điều này đáng được nói riêng, vì đó là cùng một loại sai lầm. Xóa trang PDF tạo ra một tài liệu mới từ những trang bạn giữ lại — nhưng một liên kết trên trang được giữ lại mà trỏ tới một trang đã xóa vẫn phải trỏ được tới đâu đó, nên nó kéo theo một bản sao của trang đã xóa vào file mới dưới dạng một đối tượng mà không cây trang nào tham chiếu tới. Vô hình trong mọi trình đọc, nhưng vẫn có mặt trong từng byte.
Để bỏ một trang khỏi tầm nhìn, xóa trang là đúng và đủ. Để nội dung của nó thực sự không còn tồn tại, hãy xóa trang và dựng lại file như trên.
Câu hỏi thường gặp
Ô đen có bao giờ chấp nhận được không?
Chỉ khi là dấu hiệu hình ảnh nằm trên một lần che thông tin thực sự. Nếu chỉ có mỗi ô đen, nó chỉ che chữ khỏi người đọc không để ý và không ai khác. Nếu tài liệu sẽ được công bố, nộp hoặc cung cấp cho bên khác, hãy coi một ô đen đơn thuần là hoàn toàn chưa che thông tin.
Làm phẳng PDF thay vào đó thì sao?
Làm phẳng sẽ in chú thích vào trang, khiến một ô đã vẽ trở thành hình vẽ cố định — nhưng chữ bên dưới là nội dung trang, không phải chú thích, nên vẫn còn nguyên đó. Làm phẳng là công cụ đúng để cố định câu trả lời trong biểu mẫu và chữ ký, không phải để giấu chữ.
Tôi có thể che thông tin bằng cách chuyển PDF thành ảnh không?
Được, theo nghĩa là ảnh của một trang có ô đen thì thực sự không có chữ nào bên dưới. Cái giá là có thật: tài liệu không còn tìm kiếm được, file nặng hơn, và metadata thường vẫn bị mang theo — nên bạn vẫn phải xóa nó riêng.
In ra PDF có xóa được chữ ẩn không?
Thường là có đối với nội dung trang, vì trang được kết xuất lại — đó là lý do đôi khi cách này tình cờ có tác dụng. Nhưng đây không phải là phương pháp đáng tin cậy, nó không xóa hết mọi trường metadata, và phụ thuộc vào trình điều khiển máy in. Hãy dùng công cụ nói rõ nó xóa những gì.
Che thông tin tài liệu nhạy cảm trên một website có an toàn không?
Trên trang này không lưu trữ gì cả ở bất kỳ bước nào, và đó chính là lý do công cụ che thông tin có mặt ở đây — những tài liệu mọi người cần che thông tin chính là những tài liệu không nên nằm trên máy chủ của người lạ. Với hồ sơ pháp lý, hãy dùng phần mềm chuyên dụng xứng với mức độ quan trọng và tự kiểm tra kết quả.
Bài viết đáng đọc khác
File PDF quá nặng để gửi email
Ba nguyên nhân khiến file PDF nặng, và cách xử lý hợp với file của bạn.
Nên dùng định dạng ảnh nào?
Một câu hỏi quyết định tất cả. So sánh thẳng thắn JPG, PNG, WebP và AVIF.
PDF scan và OCR
Vì sao bản scan không chứa chữ, OCR bổ sung những gì, và cài đặt quyết định độ chính xác.