Pular para o conteúdo

Extrair o texto de uma imagem

Leia as palavras de uma foto, uma digitalização ou uma captura de tela e leve-as como texto que você pode editar, pesquisar e colar. A imagem nunca fica armazenada.

  • Nunca armazenado
  • Sem fila, sem espera
  • Sem cadastro, sem marca d'água

Como funciona

1

Adicione sua imagem

JPG, PNG, WebP, GIF, BMP, um HEIC do iPhone ou o TIFF de um scanner. Uma foto tirada em ângulo é endireitada e tem a iluminação nivelada antes da leitura.

2

Confira o idioma

O sistema de escrita é identificado na imagem e o idioma é escolhido para você. Há mais de 120 disponíveis caso ele erre ou a imagem tenha mais de um.

3

Copie ou baixe

Mantenha o layout, com as linhas e colunas onde estavam, ou junte as linhas em parágrafos corridos, prontos para colar em outro lugar.

Como a imagem é lida

O tamanho que o leitor quer é medido pela tinta, e não pelo arquivo. A altura de uma linha de texto é estimada a partir da própria imagem, e tudo é redimensionado para que uma linha fique com cerca de trinta e quatro pixels — uma captura de tela pequena é ampliada até quatro vezes, e uma foto enorme é reduzida, com o lado maior limitado nos dois casos. É por isso que uma foto de nove megapixels de um cardápio não é mais precisa do que uma pequena e nítida, e por isso que uma imagem com menos de uns trezentos pixels no lado menor pula totalmente a detecção de idioma e é lida como escrita latina. Antes de tudo isso, o papel por trás da tinta é estimado em blocos e descontado para nivelar a iluminação, a inclinação da página é medida ao longo de toda a sua altura e corrigida, e o resultado é convertido em preto e branco com um único limiar global.

Escolher o idioma é um teste, e não uma consulta, porque o detector habitual não detecta idiomas. A primeira passagem informa o sistema de escrita e a rotação, nada mais; o sistema de escrita reduz as opções, as configurações de idioma do seu navegador desempatam entre idiomas que compartilham o mesmo, e então cada candidato é de fato usado para ler uma cópia reduzida da imagem e recebe uma nota pela quantidade de palavras confiáveis que produziu. O vencedor lê a página de verdade, e o texto reconhecido é examinado de novo — em busca de acentos, pares de letras característicos, palavras curtas comuns — para ver se outro idioma se sairia melhor. Essa é a engrenagem por trás de “indicar o idioma errado gera uma página vazia com toda a confiança”: o teste existe justamente para que o palpite seja verificado contra a sua imagem, e não simplesmente afirmado.

Vale saber uma coisa sobre o que chega ao resultado. Um parágrafo em que o leitor não tinha confiança é descartado em vez de exibido, então um texto que você vê na imagem pode faltar por completo no resultado, em vez de aparecer como algo sem sentido. O mesmo vale para blocos que o leitor classificou como imagem ou ruído, e para marcas isoladas sem nenhuma letra ou dígito. Nenhum corte é aplicado a palavras comuns com baixa confiança, então erros de leitura dentro de um parágrafo sobrevivem e cabe a você identificá-los. Quando o índice de confiança é razoável e um pedaço da página simplesmente não está lá, foi isso que aconteceu.

Quando você precisa de outra coisa

Nada fica armazenado, mas esta é a única ferramenta do site em que a primeira execução não sai de graça: o leitor em si tem alguns megabytes e cada pacote de idioma tem mais um a cinco, baixados deste site e guardados para a próxima vez. Uma única página vale a espera, e duas mil digitalizações programadas não valem — isso é trabalho para uma ferramenta de OCR para desktop como o OCRmyPDF, que adiciona uma camada de texto a uma pasta inteira com um comando, sem download e sem cliques.

Três coisas simplesmente não são tentadas aqui, e saber quais são é mais rápido do que descobrir. A perspectiva não é corrigida — a rotação da página é medida e corrigida, mas uma foto tirada de lado mantém o formato de trapézio, então vale o segundo a mais para fotografar bem de cima. O limiar que separa a tinta do papel é um valor único para a imagem inteira, e não um por região, então uma página meio na sombra vai perder a metade mais escura mesmo depois de nivelar a iluminação; fotografe de novo com luz uniforme em vez de brigar com ela. E uma tabela montada com espaçamento, sem linhas de grade, não tem linhas para encontrar, então é lida como colunas de texto e só sobrevive à colagem em uma planilha por sorte.

Perguntas frequentes

Qual é a precisão?

Em texto impresso nítido, fotografado de frente e em foco, muito alta — alguns caracteres em mil. A precisão cai com desfoque, reflexo, baixo contraste e fontes incomuns, e a página mostra o grau de confiança da leitura em vez de deixar você adivinhando. Se o número for baixo, o problema costuma ser a imagem: mais luz, menos ângulo e o texto ocupando todo o quadro resolvem quase tudo.

Minha imagem fica armazenada em algum lugar?

Não. O pacote de idioma vem deste site na primeira vez que você usa um idioma; a imagem em si nunca fica armazenada nem é enviada a lugar nenhum, então funciona até com o Wi-Fi desligado.

Quais idiomas ele lê?

Mais de 120, incluindo inglês, bengali, hindi, urdu, árabe, espanhol, francês, alemão, português, russo, chinês, japonês e coreano. O sistema de escrita é identificado na própria imagem; quando vários idiomas usam o mesmo — latino, cirílico, árabe, devanágari —, o idioma do seu navegador decide, e você sempre pode trocar.

Ele mantém as colunas e a tabela?

Sim, se você pedir. Tabelas com linhas de grade são encontradas e lidas célula por célula, para que um rótulo não se misture ao seu valor, e voltam como linhas separadas por tabulação que você cola direto em uma planilha. Colunas de texto corrido são lidas na ordem de leitura, e não em linha reta de um lado a outro. Escolher juntar as linhas descarta essa estrutura de propósito, que é o que você quer para um parágrafo que vai reformatar.

Ele lê escrita à mão?

Letra de forma caprichada e separada — maiúsculas em um formulário — muitas vezes sai bem. Letra cursiva não sai, nem aqui nem em qualquer outra ferramenta de OCR genérica; a resposta honesta é que é outro problema, que exige outra abordagem. Há uma página separada para escrita à mão que diz isso com clareza e mostra o que conseguiu ler.

Quais formatos de imagem funcionam?

JPG, PNG, WebP, GIF, BMP e SVG pelo próprio navegador, mais HEIC do iPhone e TIFF de scanner. Uma foto tirada no celular na vertical sai na posição certa, porque a informação de orientação gravada pela câmera é aplicada primeiro.

Por que ele errou algumas palavras?

Quase sempre por causa da imagem, e não do texto: um reflexo na página, a sombra da sua mão, a câmera tremida ou um texto tão pequeno na tela que cada letra tem só alguns pixels. O leitor recebe a imagem redimensionada para o tamanho em que lê melhor, com a iluminação nivelada antes, mas nenhum tratamento inventa detalhes que a câmera não captou.

Existe limite de tamanho?

Só a memória do seu próprio dispositivo. Nada fica armazenado, então não há limite de servidor. Uma foto muito grande é reduzida ao que o leitor consegue usar — a partir de certo ponto, mais pixels só aumentam o custo, não a precisão.

Bom saber: Letra cursiva não é reconhecida de forma confiável por nenhuma ferramenta de OCR genérica, incluindo esta. Texto impresso sobre uma imagem, letras muito estilizadas e contraste muito baixo sairão com falhas. O resultado é texto simples: fontes, cores, negrito e itálico não são mantidos, nem a própria imagem.

Coloque esta ferramenta no seu site

Grátis para qualquer blog, página de turma ou artigo de ajuda. Cole um único trecho de código e seus visitantes podem usá-la direto na sua página.