Convertir PDF a Excel
Saca las tablas de un PDF a un .xlsx real que puedes ordenar, filtrar y sumar, reconstruido a partir de la propia página.
- Nunca se guarda
- Sin filas ni esperas
- Sin registro, sin marca de agua
Cómo funciona
Agrega tu PDF
Suelta el documento que contiene la tabla que necesitas.
Convierte
Las filas se detectan a partir de líneas base compartidas, y las columnas, a partir de dónde empieza el texto en la página.
Descarga
Una hoja por página, que se abre en Excel, Google Sheets, Numbers y LibreOffice.
Cómo se recupera una cuadrícula de algo que no la tiene
Un PDF no contiene tablas. Contiene caracteres en coordenadas, y las líneas que parecen una tabla son dibujos sin ninguna conexión con el texto que hay dentro. Por eso la cuadrícula se deduce, con dos reglas que vale la pena conocer con exactitud. Las filas salen de líneas base compartidas, con la posición vertical redondeada en tramos de cuatro puntos para que un superíndice o un símbolo de moneda un poco elevado no inicie una fila propia. Las columnas salen de reunir todos los bordes izquierdos distintos de la página y unir los que estén a menos de ocho puntos entre sí; esto se hace en toda la página y no fila por fila, así que una columna que está vacía en una línea sigue ocupando su lugar en las demás.
Por eso los números alineados a la derecha son el caso difícil, y vale la pena decirlo claramente porque es la decepción más común aquí. Una columna de cifras alineada a la derecha tiene un borde izquierdo distinto en cada fila (9.99 empieza mucho más a la derecha que 1,234,567.89) y, en cuanto esos bordes difieren en más de ocho puntos, se leen como columnas distintas. Por eso una tabla financiera puede llegar repartida en varias columnas que deberían ser una sola. Las columnas alineadas a la izquierda y centradas no tienen este problema. Dos textos que sí caen en la misma celda se unen con un espacio en lugar de sobrescribirse.
Al exportar, cada celda recibe un tipo: todo lo que se interpreta limpiamente como número se escribe como número y se puede sumar, y todo lo demás se escribe como texto. Los adornos contables habituales no se interpretan (un separador de miles, un signo de porcentaje al final, un símbolo de moneda o un negativo escrito entre paréntesis como (1,234)), así que esas celdas llegan como texto que parece numérico y se niega a sumar. La función “Texto en columnas” de Excel arregla una columna entera de ellas de una sola vez.
Cada página se convierte en su propia hoja, llamada Page 1, Page 2 y así sucesivamente, en lugar de unirse en una sola tabla continua: una tabla de tres páginas llega como tres hojas con el encabezado repetido. Lo que se traslada son solo los valores. Las fórmulas nunca estuvieron en el PDF para recuperarlas, y los colores de relleno, los bordes, las fuentes, las celdas combinadas y los gráficos no se reconstruyen a propósito, porque adivinarlos produce una hoja de cálculo que parece fiable y tiene errores sutiles.
Si buscas otra cosa
Extraer tablas es un verdadero problema de investigación, y hay herramientas que no hacen otra cosa. Tabula es la que conviene usar cuando las tablas tienen líneas: lee las líneas dibujadas como la cuadrícula en lugar de deducirla de la posición del texto, lo que resuelve por completo el caso de los números alineados a la derecha. Es gratuita, tiene una interfaz de apuntar y hacer clic y exporta a CSV. Camelot hace lo mismo desde Python, con un modo lattice para tablas con líneas y un modo stream para tablas sin líneas, y te dice qué tan seguro está.
Cuando el diseño es sencillo y solo quieres que sea legible, pdftotext -layout in.pdf out.txt de Poppler conserva el espaciado de las columnas como texto sin formato, que se abre directamente en una hoja de cálculo como datos de ancho fijo y se salta la deducción por completo. Y si el PDF es un escaneo, nada de esto aplica: no hay texto que posicionar, y primero necesita OCR.
Preguntas frecuentes
¿Cómo puede una tabla de PDF convertirse en una hoja de cálculo?
Un PDF no tiene el concepto de tabla: solo caracteres en coordenadas. La cuadrícula se reconstruye: el texto que comparte línea base se convierte en una fila, y los bordes izquierdos del texto de toda la página se agrupan en columnas, así que una celda vacía en una fila sigue ocupando su lugar en las demás.
¿Qué tan preciso es?
Muy bueno con tablas limpias, con líneas y con columnas uniformes. Tiene problemas con las celdas combinadas, el texto con saltos de línea dentro de una celda y las columnas que se desplazan a lo largo de la página, todo lo cual es realmente ambiguo si no se sabe qué significa la tabla. Revisa el resultado antes de confiar en él.
¿Los números siguen siendo números?
Sí. Todo lo que se lee como un número se escribe como una celda numérica, así que los totales y las fórmulas funcionan de inmediato en lugar de tratarse todo como texto.
¿Se guarda mi PDF en algún lugar?
No. Cada página se lee sin guardarse.
¿Y si es un PDF escaneado?
Un escaneo no tiene texto que extraer. Pásalo primero por OCR PDF y luego conviértelo.
Conviene saber: Las celdas combinadas, las celdas de varias líneas y las columnas que se desplazan son los casos difíciles y quizá necesiten un repaso después. El formato, los colores, las fórmulas y los gráficos no se recrean; los valores sí. Cada página del PDF se convierte en su propia hoja en lugar de unirse en una sola tabla larga.
Agrega esta herramienta a tu sitio web
Gratis para cualquier blog, página de clase o artículo de ayuda. Pega un fragmento de código y tus visitantes podrán usarla directamente en tu página.
Más Herramientas PDF
Excel a PDF
XLSX a PDF, tal como lo imprime Excel
PDF a Word
Convierte a .docx editable, con OCR para escaneos
PDF a texto
Texto sin formato que puedes copiar y editar
PDF a PowerPoint
Diapositivas editables a partir de cualquier PDF
PDF a JPG
Cada página como imagen JPG
PDF a PNG
Imágenes de página nítidas y sin pérdida