Converter PDF em Excel
Tire as tabelas de um PDF para um .xlsx de verdade, que você pode ordenar, filtrar e somar — reconstruídas a partir da própria página.
- Nunca armazenado
- Sem fila, sem espera
- Sem cadastro, sem marca d'água
Como funciona
Adicione seu PDF
Solte o documento que contém a tabela de que você precisa.
Converta
As linhas são encontradas pelas linhas de base em comum, e as colunas, por onde o texto começa na página.
Baixe
Uma aba por página, que abre no Excel, no Google Planilhas, no Numbers e no LibreOffice.
Como uma grade é recuperada de algo que não tem nenhuma
Um PDF não contém uma tabela. Ele contém caracteres em coordenadas, e as linhas que parecem uma tabela são desenhos sem ligação com o texto dentro delas. Então a grade é deduzida, por duas regras que vale conhecer com exatidão. As linhas vêm das linhas de base em comum, com a posição vertical arredondada em faixas de quatro pontos, para que um sobrescrito ou um símbolo de moeda um pouco mais alto não comece uma linha própria. As colunas vêm de reunir todas as margens esquerdas distintas da página e juntar quaisquer duas que estejam a menos de oito pontos uma da outra — na página inteira, e não linha por linha, para que uma coluna que por acaso esteja vazia em uma linha continue ocupando o seu lugar nas outras.
É por isso que números alinhados à direita são o caso difícil, e vale dizer isso com clareza, porque é a decepção mais comum aqui. Uma coluna de valores alinhada à direita tem uma margem esquerda diferente em cada linha — 9,99 começa bem mais à direita que 1.234.567,89 — e, quando essas margens diferem em mais de oito pontos, são lidas como colunas diferentes. Uma tabela financeira pode, então, chegar espalhada por várias colunas que deveriam ser uma só. Colunas alinhadas à esquerda ou centralizadas não têm esse problema. Dois trechos de texto que caem na mesma célula são unidos com um espaço, em vez de um sobrescrever o outro.
As células recebem um tipo na saída: tudo o que é lido sem ambiguidade como número é gravado como número e pode ser somado, e todo o resto é gravado como texto. As decorações contábeis comuns não são lidas — separador de milhar, sinal de porcentagem no final, símbolo de moeda ou um negativo escrito como (1.234) entre parênteses —, então essas células chegam como texto que parece número e se recusa a somar. O próprio recurso Texto para Colunas do Excel corrige uma coluna inteira delas de uma vez.
Cada página vira uma aba própria, chamada Página 1, Página 2 e assim por diante, em vez de ser emendada em uma tabela contínua — uma tabela de três páginas chega como três abas, com o cabeçalho repetido. O que vem são só os valores. As fórmulas nunca estiveram no PDF para serem recuperadas, e cores de preenchimento, bordas, fontes, células mescladas e gráficos de propósito não são reconstruídos, porque adivinhá-los produz uma planilha que parece confiável e está sutilmente errada.
Quando você precisa de outra coisa
A extração de tabelas é um problema de pesquisa de verdade, e existem ferramentas que não fazem outra coisa. O Tabula é o indicado quando as tabelas têm linhas de grade: ele lê as linhas desenhadas como a grade, em vez de deduzi-la pela posição do texto, o que resolve de vez o caso dos números alinhados à direita. É gratuito, tem uma interface de apontar e clicar e exporta CSV. O Camelot faz o mesmo em Python, com um modo lattice para tabelas com linhas de grade e um modo stream para as sem linhas, e ainda informa o quanto está confiante.
Quando o layout é simples e você só quer algo legível, o pdftotext -layout in.pdf out.txt do Poppler preserva o espaçamento das colunas em texto simples, que abre direto em uma planilha como dados de largura fixa e dispensa toda a dedução. E se o PDF for uma digitalização, nada disso se aplica — não há texto para posicionar, e ele precisa de OCR antes.
Perguntas frequentes
Como uma tabela de PDF pode virar planilha?
Um PDF não tem o conceito de tabela — só caracteres em coordenadas. A grade é reconstruída: o texto que compartilha uma linha de base vira uma linha, e as margens esquerdas do texto na página inteira são agrupadas em colunas, então uma célula vazia em uma linha continua ocupando o seu lugar nas outras.
Qual é a precisão?
Muito boa em tabelas limpas, com linhas de grade e colunas consistentes. Tem dificuldade com células mescladas, texto quebrado dentro de uma célula e colunas que se deslocam ao longo da página — tudo isso é realmente ambíguo sem saber o que a tabela significa. Confira o resultado antes de confiar nele.
Os números continuam sendo números?
Sim. Tudo o que é lido como número é gravado como célula numérica, então totais e fórmulas funcionam na hora, em vez de tudo ser tratado como texto.
Meu PDF fica armazenado em algum lugar?
Não. Cada página é lida sem ser armazenada.
E um PDF digitalizado?
Não há texto para extrair de uma digitalização. Use OCR em PDF antes e depois converta.
Bom saber: Células mescladas, células com várias linhas e colunas desalinhadas são os casos difíceis e podem precisar de ajustes depois. Formatação, cores, fórmulas e gráficos não são recriados — os valores, sim. Cada página do PDF vira uma aba própria, em vez de ser emendada em uma única tabela longa.
Coloque esta ferramenta no seu site
Grátis para qualquer blog, página de turma ou artigo de ajuda. Cole um único trecho de código e seus visitantes podem usá-la direto na sua página.
Mais Ferramentas PDF
Excel para PDF
XLSX em PDF, exatamente como o Excel imprime
PDF para Word
Converta em .docx editável, com OCR para digitalizações
PDF para texto
Texto simples para copiar e editar
PDF para PowerPoint
Slides editáveis a partir de qualquer PDF
PDF para JPG
Cada página como uma imagem JPG
PDF para PNG
Imagens das páginas nítidas e sem perdas