Por que não dá para pesquisar em um PDF escaneado
Porque não há palavras nele. Entender o que existe de fato no arquivo explica cada sintoma e aponta a única configuração que decide o quanto ele pode ser corrigido.
Última revisão:
Não há palavras no arquivo
Um PDF pode guardar duas coisas completamente diferentes que parecem idênticas na tela. Um documento exportado do Word guarda texto — caracteres de verdade, cada um com posição e fonte —, e é por isso que você consegue selecionar uma frase, buscar um nome e copiar um parágrafo. Um documento escaneado guarda uma foto da página. Não há nada nele além de pixels, exatamente como não há nada além de pixels na foto de uma placa de trânsito.
Todos os sintomas vêm desse único fato. A busca não encontra nada porque não há nada para encontrar. Selecionar texto não funciona porque não há texto para selecionar — o cursor desenha um retângulo sobre uma imagem. Copiar não traz nada. O arquivo é grande para o número de páginas, porque imagens são pesadas e palavras não. E convertê-lo em Word gera um documento vazio ou uma imagem colada dentro de um.
O teste rápido: tente selecionar uma única palavra com o mouse. Se aparecer um cursor de texto e a palavra ficar destacada, há texto de verdade. Se aparecer uma caixa, é uma imagem.
O que o OCR realmente acrescenta
O reconhecimento óptico de caracteres lê as formas na imagem e descobre quais letras elas são. A parte útil é o que vem depois: as palavras reconhecidas são gravadas de volta no PDF como texto invisível, posicionado sobre as palavras da imagem. A página fica exatamente como era, porque visualmente nada mudou — mas agora pode ser pesquisada, selecionada, copiada e indexada.
É um projeto deliberadamente conservador, e é o certo para documentos. Nada é recomposto, então um contrato continua com a cara do contrato que foi assinado, e a digitalização original continua sendo o registro visual. Tornar um PDF escaneado pesquisável faz isso em uma passada e, em geral, também endireita e gira as páginas, porque a leitura já precisava disso.
Se o que você quer é um documento editável, e não pesquisável, esse é um trabalho diferente e bem mais difícil: o texto precisa ser extraído, o layout deduzido e o resultado reconstruído como parágrafos e tabelas. Converter em Word faz isso, e o resultado sempre precisa ser conferido, algo que uma camada de texto não exige.
A configuração que decide tudo: 300 DPI
A precisão do reconhecimento depende muito mais da digitalização do que do software, e o número mais importante é a resolução. 300 DPI é o padrão, e não é arbitrário — ele coloca uns 30 pixels de altura em um texto comum, o que é bem mais que o mínimo necessário para distinguir letras de formato parecido.
Em 150 DPI a precisão cai visivelmente, e os erros são do tipo traiçoeiro: um 1 lido como l, um 5 como S, rn como m. Abaixo disso, piora rápido. Passar de 300 raramente ajuda e deixa os arquivos muito maiores — 600 DPI só vale a pena para letras muito pequenas ou originais ruins.
Outras três configurações de captura importam quase tanto. Tons de cinza, e não preto e branco, porque um limiar rígido destrói as partes finas das letras. Página plana e alinhada com o sensor, porque em uma página fotografada em ângulo as letras mudam de forma ao longo da página. E iluminação uniforme — a falha clássica é a sua própria sombra caindo sobre a página que você fotografa de cima.
O que nenhum OCR consegue ler
Ser honesto sobre isso economiza muito tempo. Letra cursiva não é reconhecida pelo OCR de uso geral, e o motivo é estrutural, não falta de esforço: ler texto impresso funciona encontrando os limites entre as letras, e na letra cursiva eles não existem. Letras de forma escritas à mão, letras maiúsculas e campos de formulário costumam funcionar bem, porque são formas separadas, com espaço entre elas.
Texto que faz parte de uma foto — palavras em uma placa, em um produto, sobre um fundo carregado — é muito mais difícil que texto no papel, e letras muito estilizadas ou decorativas são mais difíceis ainda. Cópias de cópias perdem os traços finos que distinguem as letras. E um documento carimbado, anotado ou marcado com marca-texto é lido pior onde as marcas se sobrepõem ao texto.
Uma boa ferramenta informa o quanto estava confiante, e esse número existe para ser usado. Uma confiança baixa no meio de uma frase que você entende pelo contexto importa muito menos que uma confiança baixa em um dígito de um número de conta. Os erros perigosos são os confiantes, porque nada os sinaliza.
Por que isso importa além da comodidade
Um acervo escaneado sem camada de texto está, na prática, perdido. Nada consegue pesquisá-lo, nada consegue indexá-lo, nenhum sistema de compliance encontra um nome nele e nenhum leitor de tela consegue lê-lo em voz alta — o que, em muitas jurisdições, faz de publicá-lo um problema jurídico, e não um mero inconveniente.
É também por isso que vale insistir em escanear com as configurações certas logo na primeira vez. Escanear de novo uma caixa de documentos custa muito mais do que escaneá-la direito uma vez, e nenhum processamento recupera detalhes que nunca foram capturados.
As ferramentas para isto
Perguntas frequentes
Qual é a precisão real do OCR?
Em uma digitalização limpa a 300 DPI de texto impresso comum, muito alta — a ponto de os erros serem ocasionais, e não rotineiros. Em uma foto de celular tirada em ângulo e com pouca luz, drasticamente pior. A qualidade da digitalização importa muito mais que a escolha do software.
O OCR vai mudar a aparência do meu documento?
Não. O texto reconhecido é adicionado de forma invisível sobre a imagem existente, então a página fica exatamente como era. Em geral, as páginas são endireitadas e colocadas na posição certa durante o processo, o que faz digitalizações tortas ficarem melhores, e não diferentes.
Posso editar o texto depois de rodar o OCR?
Não no próprio PDF — a página visível continua sendo uma imagem, e a camada de texto fica invisível por cima dela. Para ter algo editável, converta o documento reconhecido em Word e conte com a necessidade de revisar o resultado.
O OCR funciona com letra à mão?
Letras de forma separadas, escritas à mão, e formulários preenchidos costumam funcionar. Letra cursiva não funciona em nenhuma ferramenta de OCR de uso geral — as letras se emendam, sem limites para encontrar. Ferramentas treinadas especificamente com escrita à mão se saem melhor, ao custo de enviar suas páginas a terceiros.
Por que meu PDF pesquisável ficou tão maior?
Ele quase não deveria mudar — uma camada de texto ocupa poucos kilobytes por página. Se cresceu muito, as páginas provavelmente foram renderizadas de novo em vez de mantidas, o que vale conferir, já que a ideia de uma camada de texto é preservar a imagem original intacta.
Vale a pena ler também
PDF grande demais para o e-mail
Os três motivos de um PDF ser grande, e qual solução serve para o seu.
Qual formato de imagem?
Uma pergunta decide. JPG, PNG, WebP e AVIF comparados com honestidade.
Tarjar um PDF do jeito certo
Por que uma caixa preta não esconde nada, e onde o PDF guarda nomes que você esqueceu.