PDF涂黑脱敏
删除姓名、号码以及任何不能被读到的内容——从文档本身删除,而不是遮盖。不存储任何文件。
- 绝不存储
- 无需排队,无需等待
- 无需注册,无水印
使用方法
添加PDF
拖放文档,每一页都会放大显示,足以精确框选单个词语。
框选要删除的内容
在每段文字上拖出一个框。“撤销”和“全部清除”一键可用,保存之前什么都不会改变。
涂黑并下载
被框住的文字会先从文件中删除,然后再在上面画上黑框。
为什么黑色矩形不等于涂黑脱敏
这个错误曾经断送过职业生涯、输掉过官司,所以值得直截了当地说:在PDF里的文字上画一个黑框,什么都没隐藏。字符仍然在页面的内容流里,就在矩形下面,任何人都能选中、复制,或用免费工具在大约四秒内提取出来。您读到过的每一起公开的涂黑失败事件——和解金额、证人姓名、未涂黑的诉讼文件——都是有人画了一个图形,就以为万事大吉。
这里的顺序正好相反。您所框选矩形内的文字会先从内容流中删除,之后才画上黑框,作为此处曾有内容的视觉标记。复制被涂黑的区域,得到的是空白,因为那里什么都没有;提取页面文字,那些词语也不在其中。工具会显示删除了多少处内容,这样一次悄悄什么都没匹配到的涂黑操作会被您看到,而不是被想当然。
图形是另一个问题,也有另一种解决办法。扫描页面里的名字,或粘贴在报告中的截图里的名字,根本不是文字——而是像素,删除文字碰不到它们。开启图形选项后,这些页面会在涂黑已生效的状态下重新渲染,下面的像素是真正消失了,而不是被遮住。代价是实实在在的,我们也直说:这些页面会变成图片,上面的文字将无法再被选中,文件也会变大。
PDF存放名字的地方不止页面,其余位置在这里不会被处理。书签大纲、表单字段值、文件附件、文档信息、XMP元数据包以及文件名本身,都是独立的存储位置,其中任何一处的名字都能在页面被完美涂黑后幸存下来。如果文档曾以增量方式保存,较早的版本也是如此。在涂黑后的文件发往任何重要的地方之前,请打开文档属性看一看,并对结果做一次重建,丢弃页面已不再引用的内容。
如果您需要的是别的
当涉及法律风险时,请使用为此而生的软件。Adobe Acrobat Pro的涂黑功能采用同样的先删除、再标记的逻辑,并提供了本页面无法提供的功能:一个清理(sanitise)步骤,一次性去除元数据、附件、隐藏图层、脚本和以前保存的修订版本。对于提交法院的文件,这一步不可省略。
免费的替代方案是一个两条命令的流程,而且确实很彻底。qpdf --qdf --object-streams=disable in.pdf out.pdf 把文档结构展开成可读的文本,让您亲眼确认名字已经消失;exiftool -all:all= out.pdf 清除元数据。之后再运行 gs -sDEVICE=pdfwrite -o final.pdf out.pdf,根据页面实际引用的内容重建文件,丢弃孤立对象。核实是人们最常跳过的一步,也恰恰是最重要的一步。
常见问题
这和画一个黑色矩形有什么不同?
完全不同,而这正是关键所在。在PDF编辑器里画的黑色矩形什么都没隐藏:字符仍在文件里,任何人都能选中、复制,或用免费工具提取出来。报社和政府部门就曾经这样泄露过信息。在这里,文字会先从页面的内容流中删除,之后才画上黑框——在任何阅读器中选中黑色区域,都没有可复制的内容。
我的文档会被存储吗?
不会。涂黑脱敏过程不存储任何内容,这一点在这里比任何其他工具都更重要:人们需要脱敏的文档,恰恰是他们最不愿意交给网站的文档。
黑框下面的照片和扫描内容怎么办?
文字会从内容流中删除,但图片中的像素是另一回事。开启“同时清除下面的图形”后,受影响的页面会被重建为扁平化的图片,框下的内容在文件中将不复存在。代价是这些页面会失去文字层,所以它是一个可选项,而不是默认设置。
我能检查是否成功了吗?
可以,而且应该检查。打开结果,尝试选中被涂黑的区域,或者用PDF转文本处理一遍——那些文字应该已经不见了。无论使用什么工具,发送之前核实涂黑效果都是个好习惯。
它也会删除元数据吗?
暂时不会。作者姓名和标题存放在文档信息中,而不在页面上。发布敏感内容之前,请单独检查这些信息。
小贴士: 文字会从页面内容中删除;如果某个名字还出现在书签、表单字段、附件或文档元数据中,这些是独立的位置,不会被处理。要涂黑扫描图片中的文字,需要开启图形选项,这会把相关页面扁平化并移除其文字层。
把这个工具放到您的网站上
博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。