Saltar al contenido

Reparar PDF

Rescata un PDF que no se abre. Se reconstruye el índice del archivo y, si el documento no se puede analizar en absoluto, se recupera todo lo que aún se puede leer en los bytes. Y no se guarda nada.

  • Nunca se guarda
  • Sin filas ni esperas
  • Sin registro, sin marca de agua

Cómo funciona

1

Agrega el PDF dañado

Suelta el archivo que no se abre. No importa que otras aplicaciones lo rechacen.

2

Repara

El archivo se vuelve a indexar o, si no se puede analizar, se reconstruye objeto por objeto.

3

Revisa y descarga

Te decimos cuántas páginas se recuperaron y qué se hizo, y luego descargas el archivo reparado.

Qué suele estar roto y las dos formas de recuperarlo

La mayoría de los PDF que no se abren no están dañados en ningún sentido importante. Un PDF termina con una tabla de referencias cruzadas, un índice que registra la posición en bytes de cada objeto del archivo, y los lectores la usan para encontrar cualquier cosa. Si ese índice se corrompe, un documento perfectamente intacto deja de abrirse, porque no se puede localizar nada aunque todo esté ahí. Descargas interrumpidas, un guardado que se cortó, una aplicación que se colgó, un archivo editado por algo que no actualizó las posiciones, una transferencia que alteró los saltos de línea: todo eso rompe el índice y nada de eso toca el contenido.

La primera pasada aprovecha justamente eso. El archivo se analiza de forma permisiva, ignorando las posiciones declaradas cuando no coinciden con lo que realmente hay, y luego se vuelve a escribir con un índice correcto, longitudes de flujo correctas y un trailer limpio. Así se recupera la gran mayoría de los archivos, es rápido y no se modifica nada de las páginas: el resultado es tu documento con un índice que funciona de nuevo.

Cuando el archivo no se puede analizar en absoluto, la segunda pasada hace lo mismo que una herramienta de recuperación de escritorio: recorre los bytes en bruto de principio a fin buscando encabezados de objetos, reúne todo lo que todavía parece un objeto PDF y reconstruye el índice a partir de lo que realmente está presente, no de lo que el archivo dice tener. La página te indica cuál de las dos se ejecutó, porque importa: una reconstrucción significa que la estructura original era ilegible, y conviene revisar el resultado antes de confiar en él.

Ninguna de las dos pasadas puede inventar datos que no existen, y ninguna herramienta en ningún lugar puede. Si una descarga se detuvo al sesenta por ciento, el cuarenta por ciento final de las páginas no existe en el archivo; la recuperación encuentra las páginas que llegaron y se detiene ahí. Si el daño está dentro de un flujo comprimido, ese flujo no se puede descomprimir y la página que dibujaba sale en blanco mientras las de al lado quedan bien. Recuperar parte de un documento es el buen resultado habitual aquí, y volver a conseguir el archivo original siempre es mejor que reparar una copia incompleta.

Si buscas otra cosa

qpdf es la herramienta de referencia para esto y hace la misma primera pasada con más profundidad: qpdf --replace-input damaged.pdf reescribe el archivo con un índice correcto, y maneja documentos cifrados, flujos de objetos y archivos linealizados con los que un análisis permisivo puede tropezar. mutool clean -ggg in.pdf out.pdf va aún más lejos: reconstruye el árbol de páginas y descarta todo lo que no está referenciado. Ambos son gratuitos, ambos procesan archivos mucho más grandes de lo que cabe en una pestaña del navegador y ambos te dicen qué tuvieron que arreglar.

Para un archivo tan dañado que buscar objetos es la única opción, Ghostscript suele ser el más persistente: gs -o repaired.pdf -sDEVICE=pdfwrite broken.pdf interpreta el contenido de las páginas en lugar de solo volver a indexarlo, lo que a veces reconstruye páginas con las que las otras herramientas se rinden; a cambio lo reescribe todo, así que el resultado ya no es idéntico byte a byte a lo que sobrevivió.

Preguntas frecuentes

¿Qué se repara exactamente?

La mayoría de los PDF “corruptos” están intactos en su estructura, pero tienen dañada la tabla de referencias cruzadas: el índice que indica dónde está cada objeto. Lo causan las descargas incompletas, los guardados interrumpidos y los generadores con errores, y los lectores rechazan el archivo aunque el contenido siga ahí. Reconstruir ese índice recupera el documento de inmediato.

¿Y si el archivo no se puede analizar en absoluto?

Entonces se recorren los bytes en bruto buscando encabezados de objetos, se reúne todo lo que sigue presente y se escriben a su alrededor un índice y un trailer nuevos: la misma recuperación que hace una herramienta de escritorio. El resultado se vuelve a abrir antes de que lo recibas, así que un archivo que sigue sin cargarse se indica en lugar de descargarse.

¿Se guarda mi archivo dañado en algún lugar?

No. Ni siquiera el análisis de recuperación guarda nada. No se envía nada a ningún lado.

¿Puede recuperar un archivo cuya descarga se cortó a la mitad?

A menudo, sí, hasta el punto en que se cortan los datos. Las páginas que nunca se descargaron no se pueden inventar, así que puede que recuperes la primera parte del documento y no el documento completo.

¿Repara un PDF protegido con contraseña?

El cifrado se ignora durante la reparación, así que un archivo protegido solo quedará legible si además tienes la contraseña. Para eso, usa Desbloquear PDF por separado.

Conviene saber: La reparación recupera lo que todavía está en el archivo: no puede reconstruir datos que realmente faltan. Si un documento quedó incompleto, las páginas posteriores al corte se perdieron para siempre. Los archivos dañados dentro de sus flujos comprimidos pueden recuperarse con algunas páginas en blanco.

Agrega esta herramienta a tu sitio web

Gratis para cualquier blog, página de clase o artículo de ayuda. Pega un fragmento de código y tus visitantes podrán usarla directamente en tu página.