Convertir PDF a texto
Saca las palabras de un PDF con sus líneas y párrafos intactos: cópialas directamente al portapapeles o descárgalas en un archivo .txt. No se guarda nada.
- Nunca se guarda
- Sin filas ni esperas
- Sin registro, sin marca de agua
Cómo funciona
Agrega tu PDF
Suelta el PDF en la página. La extracción empieza de inmediato, página por página.
Lee y ajusta
El texto aparece en un cuadro editable. Activa o desactiva las marcas de salto de página y edita lo que quieras antes de guardar.
Copia o descarga
Copia todo al portapapeles o descárgalo como archivo .txt.
De dónde salen las palabras y en qué orden llegan
Los caracteres de un PDF no se guardan como texto. Se guardan como números de glifo que apuntan a una fuente incrustada, y convertirlos de nuevo en letras depende de una tabla dentro del archivo que indica qué carácter representa cada glifo. La mayoría de los programas la incluyen. Cuando uno no lo hace (y los subconjuntos recortados que generan algunos programas de diseño suelen ser los culpables), la página se ve perfecta en pantalla y se extrae como un galimatías, porque la información necesaria para leerla nunca se escribió. Ningún extractor puede arreglarlo: no es un problema difícil, son datos que faltan.
El orden de lectura es lo que hay que revisar antes de fiarse del resultado. El texto sale en el orden en que la página lo dibuja, que es el orden en que lo emitió el programa que creó el PDF, y con frecuencia no coincide con el orden en que lee una persona. Una página a dos columnas suele extraerse como una columna izquierda y una derecha bien separadas, o como líneas intercaladas entre ambas, según cómo se haya generado. Los encabezados, pies de página, números de página y recuadros laterales aparecen donde se dibujaron, normalmente en medio del texto.
Conviene reconocer algunos pequeños artefactos en vez de romperse la cabeza con ellos. Las ligaduras llegan como el carácter único que usó la fuente, así que “fin” puede aparecer como un solo glifo en lugar de una f seguida de una i, y una búsqueda simple de “fin” no lo encuentra. Las palabras cortadas con guion al final de una línea siguen con guion, porque el corte existe en el archivo. Y las comillas rectas suelen ser tipográficas, lo que importa si el texto va a acabar en código o en un CSV.
Una página escaneada no da nada en absoluto, y la herramienta lo dice en lugar de devolverte un archivo vacío: en la foto de un documento no hay caracteres, solo píxeles. Lo mismo ocurre con el texto convertido en contornos, algo que los diseñadores hacen a propósito para que un archivo se imprima igual en todas partes; a esas alturas ya es ilustración de verdad. Ambos casos necesitan OCR en lugar de extracción.
Si buscas otra cosa
Cuando las columnas importan, pdftotext -layout in.pdf out.txt de Poppler es mejor que cualquier cosa que haga un navegador: reconstruye el espaciado visual con espacios reales, así que las columnas siguen siendo columnas y una tabla sigue siendo una tabla legible. pdftotext -raw hace lo contrario y entrega el orden de dibujo sin tocar, que a veces es justo lo que necesita un script.
Para sacar el texto de cientos de archivos, mutool draw -F txt y pdfplumber de Python son la base sobre la que construir; pdfplumber en particular te da cada carácter con sus coordenadas, fuente y tamaño, así que puedes filtrar el encabezado y el pie de página por posición en lugar de a ojo. Ese es el trabajo que esta página no puede hacer, y es el que importa cuando hay volumen.
Preguntas frecuentes
¿Conserva los párrafos y los saltos de línea?
Sí. Un PDF no guarda párrafos en absoluto, solo caracteres en unas coordenadas, así que el texto se reconstruye agrupando las palabras que comparten línea base y empezando un párrafo nuevo donde aumenta el espacio vertical. El resultado se lee como el original y no como un bloque continuo.
¿Se guarda mi PDF en algún lugar?
No. El texto lo lee tu propio navegador y nunca se envía a ningún sitio. Puedes desconectarte de internet una vez cargada la página y seguirá funcionando.
Dice que mi PDF no tiene texto. ¿Por qué?
Porque es un escaneo o una foto: la página es una imagen, y las imágenes no contienen texto que extraer. Usa OCR PDF, que lee las palabras de la propia imagen.
¿Puedo editar el texto antes de descargarlo?
Sí: el cuadro es totalmente editable y lo que ves es exactamente lo que se guarda.
¿Qué pasa con las tablas y las columnas?
Las columnas se leen en el orden en que el PDF las dibuja, que suele ser el correcto, aunque en diseños complejos de varias columnas pueden intercalarse. Las tablas salen como líneas de texto, no como una cuadrícula; para tablas, usa PDF a Excel.
Conviene saber: El texto sin formato no lleva ningún formato: negritas, tamaños, colores, imágenes y estructura de tablas se pierden por definición. El texto dibujado como contornos vectoriales en lugar de caracteres reales (algo común en logotipos y en algunos PDF de diseño) no lo puede extraer ninguna herramienta sin OCR.
Agrega esta herramienta a tu sitio web
Gratis para cualquier blog, página de clase o artículo de ayuda. Pega un fragmento de código y tus visitantes podrán usarla directamente en tu página.
Más Herramientas PDF
PDF a Word
Convierte a .docx editable, con OCR para escaneos
OCR PDF
Haz que un escaneo permita buscar texto
TXT a PDF
Texto o notas en un PDF ordenado
PDF a HTML
Una sola página web independiente
PDF a PDF/A
Formato de archivo para conservación a largo plazo
PDF a Excel
Tablas convertidas en una hoja de cálculo real