Pular para o conteúdo

Tornar um PDF digitalizado pesquisável

Leia as palavras de uma digitalização e coloque-as, invisíveis, sobre as páginas. O documento continua com a mesma aparência — só passa a ser pesquisável, selecionável e copiável. Páginas digitalizadas tortas ou de lado são endireitadas.

  • Nunca armazenado
  • Sem fila, sem espera
  • Sem cadastro, sem marca d'água

Como funciona

1

Adicione seu PDF digitalizado

Solte o arquivo. A ferramenta verifica se ele já tem uma camada de texto e avisa se o OCR seria um retrocesso.

2

Confira o idioma

A ferramenta lê a primeira página e informa o idioma que encontrou. Há mais de 120 disponíveis, se você precisar escolher um.

3

Baixe

Você recebe o mesmo documento, agora com uma camada de texto oculta atrás da digitalização.

Uma camada invisível sobre uma página inalterada

A digitalização é mantida exatamente como estava. O que se acrescenta é uma camada de texto desenhada em um modo de renderização invisível — caracteres de verdade, posicionados palavra por palavra sobre as palavras da imagem, marcados para nunca serem pintados. A página parece idêntica porque, visualmente, nada mudou; selecione uma frase e o destaque cai nas palavras certas, porque o texto invisível está onde está a tinta visível. É assim que uma digitalização pesquisável é feita normalmente, e é por isso que o resultado pode ser pesquisado, copiado e indexado, mesmo continuando a ser a fotografia de um documento.

Duas coisas na página são corrigidas de propósito, porque a leitura precisava delas de qualquer jeito. Uma página digitalizada de lado é colocada em pé, e uma página que passou torta pelo alimentador é endireitada — então o resultado muitas vezes fica mais arrumado do que o original. Os tamanhos de página do PDF original são mantidos, sem padronização, então um documento com páginas de tamanhos diferentes continua assim e nada é redimensionado.

A precisão depende quase inteiramente da digitalização, e a diferença é grande. Uma digitalização limpa de texto impresso a 300 DPI é lida com precisão muito alta; a mesma página a 150 DPI é lida visivelmente pior; uma foto tirada em ângulo e com pouca luz é outra história. Se você controla a digitalização, 300 DPI em tons de cinza é a configuração que importa — mais resolução que isso raramente ajuda, e menos atrapalha na hora. Letras pequenas, espaçamento apertado entre linhas, fundos coloridos, cópias de cópias e qualquer coisa carimbada ou escrita à mão são mais difíceis de maneiras que nenhum software resolve por completo.

O que fica de fora de propósito é tão importante quanto o que entra. Fotos, logotipos, assinaturas e elementos decorativos são ignorados em vez de lidos, porque forçar letras a sair de uma imagem produz um absurdo plausível que depois aparece em toda busca. Palavras em chinês, japonês e coreano são reconhecidas, mas ficam de fora da camada de texto e são contadas para você, em vez de gravadas em branco, até que seja incluída uma fonte capaz de contê-las. Nada aqui recompõe o documento: as palavras na página continuam sendo uma imagem, e converter em Word é a ferramenta para transformá-las em texto editável.

Quando você precisa de outra coisa

O OCRmyPDF é a ferramenta ao lado da qual esta página é só uma conveniência, e ele é gratuito. ocrmypdf --deskew --rotate-pages in.pdf out.pdf faz o mesmo trabalho com mais controle, aceita --optimize 3 para reduzir o resultado, --redo-ocr para substituir uma camada existente ruim e --output-type pdfa para gerar um arquivo de arquivamento na mesma passada. Ele processa milhares de páginas, roda monitorando uma pasta e é o que bibliotecas e arquivos de documentos usam de fato.

Para material difícil — impressos históricos, layouts incomuns, tabelas pesadas — um serviço hospedado do Google, da Amazon ou da Microsoft lê páginas que o reconhecimento genérico não consegue, porque é treinado com muito mais material. É uma diferença real de capacidade, e vale conhecer. Também significa enviar seus documentos a terceiros, que é exatamente a troca que esta página existe para evitar — então é a escolha certa para um livro antigo e frágil, e a errada para uma caixa de prontuários médicos.

Perguntas frequentes

As páginas vão ficar diferentes depois?

Só mais retas: uma página digitalizada um grau fora do esquadro ou de lado é colocada na posição certa. A digitalização em si é mantida, e as palavras reconhecidas são colocadas sobre ela em tinta invisível — nunca pintadas, nunca impressas. O que muda é que o Ctrl+F passa a encontrar as coisas.

Meu documento fica armazenado em algum lugar?

Não. O reconhecimento não armazena nada. O leitor e o pacote de idioma vêm deste site na primeira vez que você usa um idioma; o documento em si nunca sai do dispositivo.

Qual é a precisão?

Em digitalizações limpas de texto impresso, muito alta. Fotos borradas, escrita à mão e fontes incomuns reduzem a precisão; a inclinação é corrigida antes da leitura. Tabelas com linhas são lidas célula por célula, para que os rótulos de formulário não se misturem com os valores.

Quais idiomas funcionam?

Mais de 120, incluindo inglês, bengali, hindi, urdu, árabe, espanhol, francês, chinês, japonês e coreano. A escrita é detectada a partir da página; quando vários idiomas compartilham a mesma escrita, o idioma do seu navegador serve de desempate, e você pode alterá-lo.

Algumas palavras não aparecem na camada de texto. Por quê?

A camada de texto só consegue conter caracteres que uma fonte incluída consegue escrever. Bengali, devanágari, árabe, tailandês e mais umas duas dezenas de escritas têm fonte própria aqui; chinês, japonês e coreano ainda não têm, então essas palavras são contadas para você em vez de salvas em branco. O PDF para Word com OCR entrega esse texto completo.

Quanto tempo leva?

Alguns segundos por página, porque é o seu próprio dispositivo que faz a leitura, e não um conjunto de servidores. O progresso aparece página por página.

Bom saber: Palavras em chinês, japonês e coreano ficam de fora da camada de texto e são contadas para você, em vez de salvas em branco, até que uma fonte para elas seja incluída; todas as outras escritas que o leitor conhece são gravadas. Imagens, logotipos e assinaturas são ignorados para nunca virarem texto sem sentido. Nenhuma ferramenta de OCR genérica reconhece escrita à mão de forma confiável.

Coloque esta ferramenta no seu site

Grátis para qualquer blog, página de turma ou artigo de ajuda. Cole um único trecho de código e seus visitantes podem usá-la direto na sua página.