Sacar el texto de una imagen
Lee las palabras de una fotografía, un escaneo o una captura de pantalla y llévatelas como texto que puedes editar, buscar y pegar. La imagen nunca se guarda.
- Nunca se guarda
- Sin filas ni esperas
- Sin registro, sin marca de agua
Cómo funciona
Agrega tu imagen
JPG, PNG, WebP, GIF, BMP, un HEIC del iPhone o el TIFF de un escáner. Una foto tomada en ángulo se endereza y se nivela su iluminación antes de leerla.
Revisa el idioma
El sistema de escritura se lee de la imagen y el idioma se elige por ti. Hay más de 120 disponibles por si se equivocó, o si la imagen contiene más de uno.
Copia o descarga
Conserva el diseño, con las líneas y columnas donde estaban, o une las líneas en párrafos continuos, listos para pegar en otro lugar.
Cómo se lee la imagen
El tamaño que necesita el lector se mide a partir de la tinta y no del archivo. La altura de una línea de texto se estima a partir de la propia imagen y todo se reescala para que una línea quede en unos treinta y cuatro píxeles: una captura de pantalla pequeña se amplía hasta cuatro veces y una fotografía enorme se reduce, con el lado más largo limitado en ambos casos. Por eso una foto de nueve megapíxeles de un menú no es más precisa que una pequeña y nítida, y por eso una imagen de menos de unos trescientos píxeles en su lado más corto se salta por completo la detección de idioma y se lee como escritura latina. Antes de todo eso, el papel detrás de la tinta se estima por zonas y se divide para nivelar la iluminación, se mide la inclinación de la página en toda su altura y se endereza, y el resultado se reduce a blanco y negro con un único umbral global.
Elegir el idioma es una audición y no una consulta, porque el detector habitual no detecta idiomas. La primera pasada informa el sistema de escritura y la rotación, nada más; el sistema de escritura acota las opciones, la configuración de idioma de tu navegador desempata entre idiomas que comparten uno, y después cada candidato se usa realmente para leer una copia reducida de la imagen y se puntúa según cuántas palabras seguras produjo. El ganador lee la página real, y el texto reconocido se vuelve a examinar (los signos diacríticos, los pares de letras característicos, las palabras cortas frecuentes) para ver si otro idioma lo haría mejor. Esta es la maquinaria detrás de “si indicas el idioma equivocado, obtienes una página vacía con total seguridad”: la audición existe precisamente para que la suposición se ponga a prueba con tu imagen en lugar de darse por sentada.
Conviene saber algo sobre lo que llega al resultado. Un párrafo del que el lector no estaba seguro se descarta en lugar de mostrarse, así que un texto que ves en la imagen puede faltar por completo en el resultado en vez de aparecer como un sinsentido. Lo mismo ocurre con los bloques que el lector clasificó como imagen o ruido, y con las marcas aisladas sin ninguna letra ni dígito. No se aplica ningún corte a las palabras comunes de baja confianza, así que las lecturas erróneas dentro de un párrafo sobreviven y te toca detectarlas a ti. Si la cifra de confianza es aceptable y simplemente falta un trozo de la página, eso es lo que pasó.
Si buscas otra cosa
No se guarda nada, pero esta es la única herramienta del sitio en la que la primera vez no sale gratis: el lector en sí pesa unos pocos megabytes y cada paquete de idioma, entre uno y cinco más, descargados de este sitio y conservados para la próxima vez. Por una sola página vale la pena esperar, pero dos mil escaneos programados no: para eso está una herramienta OCR de escritorio como OCRmyPDF, que agrega una capa de texto a toda una carpeta con un solo comando, sin descargas ni clics.
Hay tres cosas que aquí simplemente no se intentan, y saber cuáles es más rápido que descubrirlas. La perspectiva no se corrige: se mide la rotación de la página y se endereza, pero una fotografía tomada de lado conserva su forma de trapecio, así que vale la pena tomarla desde arriba aunque cueste un segundo más. El umbral que separa la tinta del papel es un único valor para toda la imagen y no uno por zona, así que una página a medias en sombra perderá la mitad oscura incluso después de nivelar la iluminación; vuelve a fotografiarla con luz uniforme en lugar de pelear con ella. Y una tabla organizada con espacios en lugar de líneas no tiene líneas que detectar, así que se lee como columnas de texto y sobrevive al pegado en una hoja de cálculo solo por suerte.
Preguntas frecuentes
¿Qué tan preciso es?
Con texto impreso nítido, fotografiado de frente y enfocado, muy preciso: unos pocos caracteres por cada mil. La precisión baja con el desenfoque, los reflejos, el poco contraste y las tipografías poco comunes, y la página te muestra qué tan seguro estaba el lector en lugar de dejarte adivinar. Si el número es bajo, el problema suele ser la imagen: más luz, menos ángulo y que el texto llene el encuadre resuelven casi todo.
¿Se guarda mi imagen en algún lugar?
No. El paquete de idioma se descarga de este sitio la primera vez que usas un idioma; la imagen en sí nunca se guarda ni se envía a ningún lado, así que funciona con el Wi-Fi apagado.
¿Qué idiomas puede leer?
Más de 120, entre ellos inglés, bengalí, hindi, urdu, árabe, español, francés, alemán, portugués, ruso, chino, japonés y coreano. El sistema de escritura se lee de la propia imagen; cuando varios idiomas comparten un mismo sistema (latino, cirílico, árabe, devanagari), decide el idioma configurado en tu navegador, y siempre puedes cambiarlo.
¿Conserva las columnas y la tabla?
Sí, si se lo pides. Las tablas con líneas se detectan y se leen celda por celda, para que una etiqueta no se mezcle con su valor, y se devuelven como filas separadas por tabulaciones que se pegan directamente en una hoja de cálculo. Las columnas de texto corrido se leen en orden de lectura y no de lado a lado. Si eliges unir las líneas, esa estructura se descarta a propósito, que es lo que quieres con un párrafo que vas a reacomodar.
¿Puede leer letra manuscrita?
La letra de molde clara y separada, como las mayúsculas de un formulario, a menudo sale bien. La letra cursiva no, ni aquí ni en ninguna otra herramienta OCR general; la respuesta honesta es que se trata de otro problema que necesita otro enfoque. Hay una página aparte para letra manuscrita que lo dice sin rodeos y te muestra lo que consiguió.
¿Qué formatos de imagen funcionan?
JPG, PNG, WebP, GIF, BMP y SVG, a través del propio navegador, además de HEIC del iPhone y TIFF de un escáner. Una foto tomada con el celular en vertical sale derecha, porque primero se aplica la marca de orientación que escribió la cámara.
¿Por qué leyó mal algunas palabras?
Casi siempre por la imagen y no por el texto: un reflejo sobre la página, la sombra de tu mano, la cámara movida o un texto tan pequeño en pantalla que cada letra ocupa apenas unos píxeles. El lector recibe la imagen escalada al tamaño con el que mejor lee, y antes se nivela la iluminación, pero ningún ajuste puede inventar detalles que la cámara no captó.
¿Hay un límite de tamaño?
Solo la memoria de tu propio dispositivo. No se guarda nada, así que no hay un límite de servidor. Una fotografía muy grande se reduce a lo que el lector puede aprovechar: a partir de cierto punto, más píxeles suman costo y no precisión.
Conviene saber: Ninguna herramienta OCR general reconoce de forma fiable la letra cursiva, y esta tampoco. El texto impreso sobre una imagen, las letras muy estilizadas y el contraste muy bajo saldrán incompletos. El resultado es texto sin formato: no se conservan las tipografías, los colores, la negrita ni la cursiva, y tampoco la imagen en sí.
Agrega esta herramienta a tu sitio web
Gratis para cualquier blog, página de clase o artículo de ayuda. Pega un fragmento de código y tus visitantes podrán usarla directamente en tu página.
Herramientas relacionadas
OCR de capturas de pantalla
Pega una captura de pantalla y obtén el texto
Escanear documento
Una página fotografiada, limpia como un escaneo
OCR PDF
Haz que un escaneo permita buscar texto
Reconocer letra manuscrita
Letra de molde, leída con honestidad
Lector de códigos QR
Mira qué dice un código QR antes de abrirlo
Lector de códigos de barras
El número de un código de barras, verificado