Cómo censurar un PDF correctamente
Un rectángulo negro sobre el texto no es una censura. Las palabras siguen en el archivo y cualquiera puede leerlas en unos cuatro segundos. Esto es lo que realmente funciona, y cómo comprobar que funcionó.
Última revisión:
El error, y por qué se sigue cometiendo
Una página PDF es un programa de dibujo. El texto es una instrucción para colocar ciertos caracteres en ciertas coordenadas, y un rectángulo negro es otra instrucción para rellenar un área. Dibujar el rectángulo no elimina el texto: lo dibuja encima. Los caracteres siguen en el archivo, debajo, y al seleccionar el área se copian. Cualquier herramienta gratuita los extrae en segundos.
Se sigue cometiendo porque la interfaz te dice que funcionó. Dibujas un recuadro, las palabras desaparecen de la vista, guardas el archivo y se ve exactamente como un documento censurado. No hay error, ni aviso, ni diferencia visible con una censura correcta. Cada fallo de censura publicado del que hayas leído (expedientes judiciales sin censurar, cifras de acuerdos, nombres de testigos, un informe de inteligencia cuyas partes suprimidas se recuperaron en minutos) fue alguien que dibujó una forma y se lo creyó.
Resaltar el texto en negro es el mismo error con otra apariencia, igual que taparlo con un rectángulo blanco en un procesador de texto antes de exportarlo a PDF.
Lo que hace una censura real
El orden se invierte. Primero se elimina el texto del contenido de la página, y después se dibuja el recuadro negro como marca visual de dónde había algo. Copia el área censurada y no obtienes nada, porque no hay nada; extrae el texto de la página y las palabras simplemente no están.
Eso es lo que hace aquí Censurar PDF, y te informa cuántos fragmentos de texto eliminó, algo que importa, porque una censura que no coincidió con nada se ve idéntica a una que funcionó. Si dibujaste un recuadro sobre un nombre y no se eliminó nada, probablemente el nombre forma parte de una imagen y no del texto, y necesitas el siguiente apartado.
El texto dentro de imágenes es otro problema
Un nombre dentro de una página escaneada, o en una captura de pantalla pegada en un informe, no es texto en absoluto: son píxeles. Eliminar texto no puede tocarlo, y un recuadro dibujado encima es exactamente el tapado ineficaz descrito arriba, porque los píxeles de debajo siguen en los datos de la imagen.
La solución es volver a renderizar esas páginas con la censura aplicada, para que los píxeles dejen de existir de verdad. Tiene un costo real que conviene conocer: esas páginas se convierten en imágenes, así que el texto que tengan deja de poder seleccionarse y el archivo pesa más. En un documento escaneado eso no cambia nada, porque ya eran imágenes. En un documento mixto es un compromiso.
Lo mismo vale para las imágenes en general. Si vas a desenfocar una cara o una matrícula, hazlo con la fuerza suficiente para que la zona no conserve ninguna estructura visible: hay investigadores que han reconstruido texto a partir de pixelados débiles generando candidatos y comparándolos. Si todavía puedes adivinar cuántos caracteres había, no es lo bastante fuerte.
Dónde guarda un PDF nombres que olvidaste
Esta es la parte que atrapa a quienes hicieron la censura correctamente. Un PDF guarda texto en más lugares que la página visible, y una censura perfecta de la página deja intactos todos ellos.
Los marcadores suelen contener títulos de sección con nombres. Los valores de los campos de formulario persisten aunque el campo no sea visible. Los archivos adjuntos pueden ser documentos completos ocultos dentro del PDF. La información del documento y el paquete de metadatos XMP llevan el título, el autor, el software y a menudo la ruta original del archivo, lo que revela un nombre de usuario y una estructura de carpetas. Los comentarios y las anotaciones tienen su propio texto y el nombre de su autor. Y el propio nombre del archivo viaja con el documento a todas partes.
Hay uno más, y es el más sutil: un PDF guardado de forma incremental conserva sus revisiones anteriores dentro del mismo archivo. Si un documento se editó y se guardó en lugar de reescribirse, una versión anterior de una página puede seguir ahí. Por eso el paso de verificación de abajo no es opcional para nada que importe.
Compruébalo, y cómo
La verificación es el paso que la gente se salta y el que realmente te protege. Tres comprobaciones, de menor a mayor profundidad.
Abre el resultado e intenta seleccionar el área censurada. Si puedes copiar algo, detente. Esto detecta el fallo básico en cinco segundos y vale la pena hacerlo todas y cada una de las veces.
Revisa las propiedades del documento. El título, el autor, el asunto y las palabras clave se ven en cualquier lector de PDF en Archivo y luego Propiedades. Si el campo de autor es el nombre que acabas de pasar una hora eliminando, la censura no sirvió de nada.
Reconstruye el archivo. Pasar el resultado por una herramienta que reescriba el documento a partir de lo que sus páginas realmente referencian (Ghostscript con gs -sDEVICE=pdfwrite, o qpdf --empty --pages out.pdf 1-z --) descarta los objetos sin referencia y las revisiones anteriores. Agregar exiftool -all:all= borra los metadatos. Para un expediente judicial o cualquier documento sujeto a divulgación, haz las tres cosas y pide a otra persona que lo revise.
Eliminar una página tampoco es censurar
Merece decirse por separado, porque es la misma clase de error. Eliminar páginas de PDF crea un documento nuevo a partir de las páginas que conservaste, pero un enlace en una página conservada que apuntaba a una página eliminada sigue teniendo que resolverse, y eso arrastra una copia de la página eliminada al nuevo archivo como un objeto que ningún árbol de páginas referencia. Invisible en cualquier lector, presente en los bytes.
Para quitar una página de la vista, eliminarla es correcto y suficiente. Para que su contenido deje de existir, elimina la página y reconstruye el archivo como se explica arriba.
Preguntas frecuentes
¿Un recuadro negro es aceptable alguna vez?
Solo como marca visual encima de una censura real. Por sí solo oculta las palabras a un lector que no está buscando y a nadie más. Si el documento se va a publicar, presentar o divulgar, trata un recuadro solo como si no hubiera censura.
¿Y si aplano el PDF?
Aplanar incrusta las anotaciones en la página, lo que sí hace permanente un recuadro dibujado como parte del gráfico, pero el texto de debajo es contenido de la página, no una anotación, así que sigue ahí. Aplanar es la herramienta correcta para fijar las respuestas de formularios y las firmas, no para ocultar palabras.
¿Puedo censurar convirtiendo el PDF en imágenes?
Funciona, en el sentido de que la imagen de una página con un recuadro encima realmente no tiene texto debajo. Los costos son reales: el documento deja de permitir búsquedas, el archivo crece y los metadatos normalmente se trasladan de todos modos, así que igual tienes que limpiarlos aparte.
¿Imprimir a PDF elimina el texto oculto?
Normalmente sí para el contenido de la página, ya que la página se vuelve a renderizar, y por eso a veces funciona por casualidad. No es un método fiable, no borra todos los campos de metadatos y depende del controlador de la impresora. Usa una herramienta que indique qué elimina.
¿Es seguro censurar un documento confidencial en un sitio web?
En este sitio no se guarda nada en ningún momento, y esa es precisamente la razón por la que aquí se ofrece la censura: los documentos que la gente necesita censurar son justo los que no deberían quedarse en el servidor de un desconocido. Para un expediente legal, usa software pensado para lo que está en juego y verifica tú mismo el resultado.
También vale la pena leer
PDF demasiado pesado para el correo
Las tres razones por las que un PDF pesa mucho, y qué solución sirve para el tuyo.
¿Qué formato de imagen?
Una pregunta lo decide. JPG, PNG, WebP y AVIF comparados con honestidad.
PDF escaneados y OCR
Por qué un escaneo no contiene texto, qué agrega el OCR y el ajuste que decide la precisión.