Cara menyensor PDF dengan benar
Kotak hitam di atas teks bukanlah sensor. Kata-katanya masih ada di dalam file, dan siapa pun bisa membacanya dalam sekitar empat detik. Inilah cara yang benar-benar berhasil, dan cara memastikan bahwa hasilnya memang berhasil.
Terakhir ditinjau
Kesalahannya, dan kenapa terus terjadi
Halaman PDF itu seperti program menggambar. Teks adalah perintah untuk menempatkan karakter tertentu di koordinat tertentu, dan kotak hitam adalah perintah lain untuk mengisi suatu area. Menggambar kotak tidak menghapus teks — kotak itu hanya digambar di atasnya. Karakternya masih ada di dalam file, di bawah kotak, dan menyeleksi area itu akan menyalinnya keluar. Alat gratis apa pun bisa mengekstraknya dalam hitungan detik.
Kesalahan ini terus terjadi karena tampilan antarmukanya seolah mengatakan semuanya berhasil. Anda menggambar kotak, kata-katanya hilang dari pandangan, Anda menyimpan file, dan hasilnya tampak persis seperti dokumen yang sudah disensor. Tidak ada error, tidak ada peringatan, dan tidak ada perbedaan yang terlihat dibandingkan sensor yang benar. Setiap kegagalan sensor yang pernah Anda baca di berita — dokumen pengadilan yang tidak tersensor, angka penyelesaian sengketa, nama saksi, laporan intelijen yang bagian hapusannya dipulihkan dalam hitungan menit — adalah ulah seseorang yang menggambar bentuk dan memercayainya.
Memberi stabilo hitam pada teks adalah kesalahan yang sama dengan wujud berbeda, begitu pula menutupinya dengan kotak putih di pengolah kata sebelum mengekspor ke PDF.
Apa yang dilakukan sensor sungguhan
Urutannya dibalik. Teksnya dihapus dari isi halaman lebih dulu, lalu kotak hitam digambar sesudahnya sebagai penanda visual bahwa di situ dulu ada sesuatu. Salin area yang disensor dan Anda tidak mendapat apa-apa, karena memang tidak ada apa-apa; ekstrak teks halamannya dan kata-kata itu memang tidak ada.
Itulah yang dilakukan Sensor PDF di sini, dan alat ini melaporkan berapa banyak potongan teks yang dihapus — ini penting, karena sensor yang tidak mengenai apa pun tampak identik dengan sensor yang berhasil. Jika Anda menggambar kotak di atas sebuah nama dan tidak ada yang terhapus, kemungkinan nama itu bagian dari gambar, bukan teks, dan perlu penanganan di paragraf berikutnya.
Teks di dalam gambar adalah masalah tersendiri
Nama di dalam halaman hasil scan, atau di dalam screenshot yang ditempel ke sebuah laporan, sama sekali bukan teks — itu piksel. Menghapus teks tidak bisa menyentuhnya, dan kotak yang digambar di atasnya adalah penutup tak efektif yang dijelaskan di atas, karena piksel di bawahnya tetap ada di data gambar.
Solusinya adalah merender ulang halaman-halaman itu dengan sensor yang sudah diterapkan, sehingga pikselnya benar-benar tidak ada lagi. Itu ada harganya, dan perlu Anda ketahui: halaman-halaman itu menjadi gambar, sehingga teks apa pun di dalamnya tidak bisa diseleksi lagi dan file-nya bertambah besar. Untuk dokumen hasil scan, tidak ada yang berubah, karena memang sudah berupa gambar. Untuk dokumen campuran, ini sebuah pertukaran.
Hal yang sama berlaku untuk gambar secara umum. Jika Anda memburamkan wajah atau pelat nomor, buat cukup kuat sehingga area itu tidak menyisakan struktur yang terlihat — peneliti pernah merekonstruksi teks dari pikselasi yang lemah dengan membuat kandidat lalu mencocokkannya. Jika Anda masih bisa menebak berapa banyak karakter di sana, berarti belum cukup kuat.
Tempat PDF menyimpan nama yang Anda lupakan
Inilah bagian yang menjebak orang yang sudah menyensor dengan benar. PDF menyimpan teks di lebih banyak tempat daripada halaman yang terlihat, dan sensor sempurna pada halaman membiarkan semua tempat itu tetap utuh.
Kerangka bookmark sering berisi judul bagian yang memuat nama. Nilai kolom formulir tetap tersimpan bahkan ketika kolomnya tidak terlihat. Lampiran file bisa berupa dokumen utuh yang tersembunyi di dalam PDF. Informasi dokumen dan paket metadata XMP membawa judul, penulis, software, dan sering kali path file aslinya — yang mengungkap nama pengguna dan struktur direktori. Komentar dan anotasi menyimpan teksnya sendiri beserta nama pembuatnya. Dan nama file itu sendiri ikut ke mana pun dokumen itu pergi.
Ada satu lagi, dan ini yang paling halus: PDF yang disimpan secara inkremental menyimpan revisi-revisi sebelumnya di dalam file yang sama. Jika dokumen diedit lalu disimpan, bukan ditulis ulang, versi lama sebuah halaman mungkin masih ada di dalamnya. Inilah alasan langkah verifikasi di bawah tidak boleh dilewatkan untuk apa pun yang penting.
Verifikasi, dan caranya
Verifikasi adalah langkah yang sering dilewatkan orang, padahal justru langkah itulah yang benar-benar melindungi Anda. Tiga pemeriksaan, dari yang paling sederhana hingga paling menyeluruh.
Buka hasilnya dan coba seleksi area yang disensor. Jika Anda bisa menyalin apa pun, berhenti. Ini menangkap kegagalan dasar dalam lima detik dan layak dilakukan setiap kali.
Lihat properti dokumen. Judul, penulis, subjek, dan kata kunci bisa dilihat di pembaca PDF mana pun lewat menu File lalu Properties. Jika kolom penulis berisi nama yang baru saja Anda hapus selama satu jam, sensor itu sia-sia.
Bangun ulang file-nya. Menjalankan hasilnya melalui alat yang menulis ulang dokumen dari apa yang benar-benar dirujuk halaman-halamannya — Ghostscript dengan gs -sDEVICE=pdfwrite, atau qpdf --empty --pages out.pdf 1-z -- — membuang objek yang tidak dirujuk dan revisi-revisi sebelumnya. Menambahkan exiftool -all:all= menghapus metadata. Untuk dokumen pengadilan atau apa pun yang wajib diungkapkan, lakukan ketiganya dan minta orang lain memeriksa.
Menghapus halaman juga bukan sensor
Ini perlu dinyatakan tersendiri, karena termasuk jenis kesalahan yang sama. Menghapus halaman dari PDF membangun dokumen baru dari halaman yang Anda pertahankan — tetapi tautan di halaman yang dipertahankan yang mengarah ke halaman yang dihapus tetap harus punya tujuan, sehingga salinan halaman yang dihapus itu ikut terbawa ke file baru sebagai objek yang tidak dirujuk oleh pohon halaman mana pun. Tidak terlihat di pembaca mana pun, tetapi ada di dalam byte-nya.
Untuk menghilangkan halaman dari pandangan, menghapus halaman sudah benar dan cukup. Untuk menghilangkan isinya sama sekali, hapus halamannya dan bangun ulang file-nya seperti di atas.
Pertanyaan yang sering diajukan
Apakah kotak hitam pernah bisa diterima?
Hanya sebagai penanda visual di atas sensor sungguhan. Kotak hitam saja hanya menyembunyikan kata-kata dari pembaca yang tidak mencarinya, dan tidak dari siapa pun selain itu. Jika dokumen akan dipublikasikan, diajukan, atau diungkapkan, anggap kotak saja sama dengan tidak disensor sama sekali.
Bagaimana kalau PDF-nya di-flatten saja?
Flatten membakar anotasi ke dalam halaman, yang memang membuat kotak yang digambar menjadi permanen sebagai grafis — tetapi teks di bawahnya adalah isi halaman, bukan anotasi, jadi tetap ada. Flatten adalah alat yang tepat untuk mengunci isian formulir dan tanda tangan, bukan untuk menyembunyikan kata-kata.
Bisakah saya menyensor dengan mengubah PDF menjadi gambar?
Bisa, dalam arti gambar halaman yang diberi kotak memang tidak punya teks di bawahnya. Tetapi harganya nyata: dokumen tidak bisa dicari lagi, file-nya membesar, dan metadata biasanya tetap ikut terbawa — jadi Anda tetap harus membersihkannya terpisah.
Apakah mencetak ke PDF menghapus teks tersembunyi?
Biasanya ya untuk isi halaman, karena halamannya dirender ulang — itulah sebabnya cara ini kadang berhasil secara kebetulan. Tetapi ini bukan metode yang andal, tidak menghapus semua kolom metadata, dan bergantung pada driver printer. Gunakan alat yang menyatakan apa saja yang dihapusnya.
Amankah menyensor dokumen sensitif di sebuah situs web?
Di situs ini tidak ada yang disimpan kapan pun, dan itulah alasan fitur sensor ditawarkan di sini — dokumen yang perlu disensor justru dokumen yang tidak seharusnya berada di server orang asing. Untuk dokumen hukum resmi, gunakan software yang dibuat untuk taruhan sebesar itu dan periksa sendiri hasilnya.
Juga layak dibaca
PDF terlalu besar untuk email
Tiga penyebab PDF berukuran besar, dan solusi mana yang cocok untuk file Anda.
Format gambar mana?
Satu pertanyaan menentukannya. JPG, PNG, WebP, dan AVIF dibandingkan secara jujur.
PDF hasil scan dan OCR
Kenapa hasil scan tidak berisi teks, apa yang ditambahkan OCR, dan pengaturan yang menentukan akurasinya.