Converter PDF em texto
Tire as palavras de um PDF com as linhas e os parágrafos intactos — copie direto para a área de transferência ou baixe um arquivo .txt. Nada fica armazenado.
- Nunca armazenado
- Sem fila, sem espera
- Sem cadastro, sem marca d'água
Como funciona
Adicione seu PDF
Solte o PDF na página. A extração começa na hora, página por página.
Leia e ajuste
O texto aparece em uma caixa editável. Ative ou desative as marcas de quebra de página e edite o que quiser antes de salvar.
Copie ou baixe
Copie tudo para a área de transferência ou baixe como arquivo .txt.
De onde vêm as palavras e em que ordem elas chegam
Os caracteres de um PDF não são guardados como texto. Eles são guardados como números de glifo que apontam para uma fonte incorporada, e transformá-los de volta em letras depende de uma tabela dentro do arquivo que diz qual caractere cada glifo representa. A maioria dos programas que geram PDF inclui essa tabela. Quando um deles não inclui — e os subconjuntos reduzidos de fontes criados por alguns softwares de design costumam ser os culpados —, a página aparece perfeita na tela e é extraída como uma sopa de caracteres, porque a informação necessária para lê-la nunca foi registrada. Nenhum extrator consegue corrigir isso; é falta de dados, não um problema difícil.
A ordem de leitura é o que você deve conferir antes de confiar no resultado. O texto sai na ordem em que a página o desenha, que é a ordem em que o software que criou o PDF resolveu gravá-lo — e muitas vezes não é a ordem em que uma pessoa lê. Uma página de duas colunas pode sair como coluna da esquerda e coluna da direita bem separadas, ou com as linhas intercaladas entre as duas, dependendo inteiramente de como foi gerada. Cabeçalhos, rodapés, números de página e barras laterais caem onde foram desenhados, geralmente no meio do texto.
Vale reconhecer alguns pequenos artefatos em vez de ficar quebrando a cabeça com eles. Ligaduras chegam como o caractere único que a fonte usou de fato, então “find” pode vir como um só glifo em vez de f seguido de i, e uma busca simples por “find” deixa de encontrá-lo. Palavras hifenizadas em uma quebra de linha continuam hifenizadas, porque a quebra existe mesmo no arquivo. E aspas retas muitas vezes são aspas curvas, o que faz diferença se o texto for parar em código ou em um CSV.
Uma página digitalizada não rende nada, e a ferramenta avisa isso em vez de devolver um arquivo vazio — não há caracteres na foto de um documento, só pixels. O mesmo vale para texto convertido em contornos, algo que designers fazem de propósito para que o arquivo seja impresso igual em qualquer lugar; a essa altura, ele é de fato uma ilustração. Nos dois casos, você precisa de OCR, não de extração.
Quando você precisa de outra coisa
Quando as colunas importam, o pdftotext -layout in.pdf out.txt do Poppler é melhor do que qualquer coisa que um navegador faz: ele reconstrói o espaçamento visual com espaços em branco reais, então colunas continuam colunas e uma tabela continua uma tabela legível. O pdftotext -raw vai no sentido oposto e entrega a ordem de desenho intacta, que às vezes é exatamente o que um script precisa.
Para extrair texto de centenas de arquivos, a base certa é o mutool draw -F txt e o pdfplumber do Python — o pdfplumber, em especial, entrega cada caractere com suas coordenadas, fonte e tamanho, para você filtrar cabeçalho e rodapé pela posição, e não no chute. Esse é o trabalho que esta página não consegue fazer, e é o que importa em grande volume.
Perguntas frequentes
Os parágrafos e as quebras de linha são mantidos?
Sim. Um PDF não guarda parágrafos — só caracteres em coordenadas —, então o texto é reconstruído agrupando as palavras que compartilham a mesma linha de base e abrindo um novo parágrafo onde o espaço vertical aumenta. O resultado se lê como o original, e não como um bloco corrido.
Meu PDF fica armazenado em algum lugar?
Não. O texto é lido pelo seu próprio navegador e nunca é enviado para lugar nenhum. Depois que a página carrega, você pode até se desconectar da internet que continua funcionando.
Diz que meu PDF não tem texto — por quê?
Porque ele é uma digitalização ou uma foto: a página é uma imagem, e imagens não contêm texto para extrair. Use o OCR em PDF, que lê as palavras da própria imagem.
Posso editar o texto antes de baixar?
Sim — a caixa é totalmente editável, e o que você vê é exatamente o que será salvo.
E tabelas e colunas?
As colunas são lidas na ordem em que o PDF as desenha, o que em geral está certo, mas pode intercalar linhas em layouts complexos de várias colunas. Tabelas saem como linhas de texto, não como grade — para tabelas, use o PDF para Excel.
Bom saber: Texto simples não tem formatação: negrito, tamanhos, cores, imagens e a estrutura de tabelas são descartados por definição. Texto desenhado como contornos vetoriais em vez de caracteres reais (comum em logotipos e em alguns PDFs feitos por designers) não pode ser extraído por nenhuma ferramenta sem OCR.
Coloque esta ferramenta no seu site
Grátis para qualquer blog, página de turma ou artigo de ajuda. Cole um único trecho de código e seus visitantes podem usá-la direto na sua página.
Mais Ferramentas PDF
PDF para Word
Converta em .docx editável, com OCR para digitalizações
OCR em PDF
Torne uma digitalização pesquisável
TXT para PDF
Texto ou anotações em um PDF organizado
PDF para HTML
Uma página web completa em um só arquivo
PDF para PDF/A
Formato de arquivamento para guardar por muito tempo
PDF para Excel
Tabelas em uma planilha de verdade