Lo que el OCR realmente hace, y lo que no puede hacer
El OCR reconoce formas y devuelve caracteres. No lee. No hay comprensión de las palabras que hay detrás, así que un “1” confundido con una “l” aparece con la misma seguridad aparente que todos los caracteres correctos que lo rodean. Por eso estas páginas muestran junto al texto el nivel de confianza del propio lector, en lugar de entregarte un resultado de aspecto limpio y dejar que tú encuentres los errores. Con texto impreso claro, fotografiado de frente y enfocado, la tasa de error es de unos pocos caracteres por cada mil. Con reflejos, una sombra o una tipografía poco común puede ser mucho peor, y nada en el resultado se verá distinto.
Detrás de estas páginas hay dos lectores. Uno encuentra el texto en cualquier parte de la página sin saber en qué escritura está, y lee unos cincuenta idiomas con un solo diccionario. El otro, entrenado por separado para cada idioma, lo respalda y cubre más de 120. Dejar el idioma en automático permite que el primer lector lo intente, y eso importa porque indicar el idioma equivocado es la forma clásica de no obtener nada: un menú en polaco identificado como cirílico y leído como ruso devuelve una página vacía, con total seguridad. Si eliges tú el idioma, el trabajo queda fijado al lector de ese idioma, que es lo que quieres cuando sabes exactamente qué tienes.
Lo que importa es la resolución, no el tamaño del archivo. El lector necesita cierta altura de letra, y todo se escala para dársela: las páginas de un PDF escaneado se renderizan a 300 DPI para leerlas, y en una imagen se mide la tinta en sí, no sus dimensiones, y después se amplía o se reduce según convenga. El texto de pantalla es el caso en que la gente se equivoca: a tamaño normal, una letra mide unos diez píxeles de alto, más o menos un tercio de lo que necesita el lector, así que una captura de pantalla se amplía antes de leerla. Por debajo de unos ocho píxeles por letra ya no queda detalle que ampliar, y ningún procesamiento lo inventa. En el otro sentido, una fotografía de 48 megapíxeles de un menú no es más precisa que una pequeña y nítida; a partir de cierto punto, más píxeles cuestan tiempo y no aportan nada.
La inclinación y la iluminación desigual arruinan más de lo que parece. Una página fotografiada está un grado o dos torcida e iluminada desde un lado, así que Imagen a texto y Escanear documento miden ese ángulo en toda la página y lo corrigen, y luego estiman por zonas el brillo del papel detrás de la tinta y lo llevan a un blanco uniforme. No es algo estético. Las líneas rectas de una tabla son lo que permite reconocerla como cuadrícula, y un contraste uniforme es lo que evita que la sombra de tu mano se lea como tinta. Una captura de pantalla no recibe ninguno de esos tratamientos, a propósito: ya está derecha y bien iluminada, y tratarla como si fuera una fotografía solo agrega errores.
Las tablas y los diseños de varias columnas son el caso realmente difícil, y vale la pena conocer las cifras. Leído como prosa de página completa, un formulario con líneas mezclaba el texto de una celda con la columna siguiente y perdía un tercio de las etiquetas: entre un quince y un veinte por ciento de caracteres incorrectos. Encontrar primero las líneas y leer cada celda por separado lo bajó a alrededor de un cinco por ciento. Así que una tabla con líneas visibles se reconoce como cuadrícula y sale como filas separadas por tabulaciones que se pegan directamente en una hoja de cálculo, y las columnas de prosa se leen en orden de lectura en lugar de en línea recta a lo ancho de la página. Una tabla organizada solo con espacios no tiene líneas que encontrar, y si sobrevive al pegado es por suerte, no por diseño.
Un PDF con texto que se puede buscar y el texto extraído son cosas distintas. OCR PDF y Escanear documento dejan la imagen exactamente como estaba y colocan encima, de forma invisible, las palabras reconocidas: la página se ve idéntica, Ctrl+F empieza a encontrar cosas, y puedes seleccionar y copiar. Nunca se pinta nada sobre la página, lo que también significa que un error de lectura se esconde dentro de un documento que se ve perfecto. Imagen a texto y OCR de capturas de pantalla hacen lo contrario: obtienes los caracteres y nada más, sin tipografías, sin colores, sin negritas y sin la imagen. Una advertencia sobre la capa de texto, porque es fácil pasarla por alto: solo puede contener caracteres que una fuente incluida pueda escribir, así que las palabras en chino, japonés y coreano se cuentan en lugar de escribirse, hasta que se incluya una fuente para ellos.
Cuándo un navegador es de verdad la herramienta equivocada
Que la imagen nunca salga de tu dispositivo es todo el argumento para leerla aquí, y eso cuesta precisión en documentos difíciles. Es una concesión real, y vale más decirlo claramente que esconderlo.
La letra cursiva no se reconoce, ni aquí ni con ninguna herramienta de OCR general. Estos son lectores de texto impreso: reconocen formas de letras, y la cursiva no tiene formas de letras separadas que reconocer. Las letras de molde escritas a mano suelen salir lo bastante bien como para corregirlas en lugar de volver a escribirlas —mayúsculas de imprenta, un formulario rellenado a mano, una nota escrita con cuidado—, y por eso existe Reconocer letra manuscrita y por eso muestra la cifra de confianza junto al texto. Leer cursiva como es debido requiere un lector entrenado específicamente con escritura a mano, y los buenos funcionan en un servidor, no en una pestaña.
El OCR en la nube superará a esto en documentos difíciles. Google, Amazon y Microsoft usan reconocedores entrenados con muchísimos más datos de los que caben en una pestaña del navegador, y con una fotografía mala, una página densa de varias columnas, una tipografía poco común o un formulario rellenado serán notablemente más precisos. También lo será un programa de escritorio de pago como ABBYY FineReader. Si la precisión en un documento difícil importa más que el hecho de que el documento se quede en tu equipo, usa uno de esos: esa es la comparación honesta, y la elección que te toca hacer.
El trabajo por lotes corresponde a la línea de comandos. Estas herramientas leen un documento cuando una persona hace clic. Dos mil escaneos de forma programada son un trabajo para una herramienta de OCR de escritorio como OCRmyPDF, que agrega una capa de texto a una carpeta entera de PDF con un solo comando: gratis, y el mismo tipo de lectura sin tener que hacer clic.
Hay cosas que simplemente no se hacen. La perspectiva no se corrige: una página fotografiada de lado conserva su forma de trapecio y solo se corrige la rotación, así que vale la pena tomar la foto desde justo encima. Un doblez marcado, o la curva cerca del lomo de un libro, se queda curvo. Y aquí no hay cámara: los lectores de códigos decodifican una imagen que ya tienes, no una transmisión en vivo.
Un costo práctico de trabajar en local: el lector y el paquete de idioma se descargan de este sitio la primera vez que usas un idioma, son unos pocos megabytes y hacen que la primera vez sea más lenta que las siguientes. Nada viene de la CDN de nadie más, y nada se envía de vuelta.
Cómo elegir entre herramientas que suenan parecido
Imagen a texto o OCR de capturas de pantalla. El mismo lector, preparado de forma distinta, y la diferencia no es estética. Una fotografía se endereza y se nivela su iluminación; una captura de pantalla se amplía y por lo demás se deja como está, porque no tiene inclinación ni iluminación desigual, y tratarla como si las tuviera la empeora. OCR de capturas de pantalla también acepta pegar: Ctrl+V, o Cmd+V en una Mac, directamente desde el portapapeles, sin guardar nada antes en el disco.
Imagen a texto o Escanear documento. Imagen a texto te da las palabras y descarta la imagen. Escanear documento conserva la imagen, la endereza, blanquea el papel detrás de la tinta y te da un PDF con aspecto de escaneo, con la opción de colocar el texto de forma invisible detrás. Si quieres pegar el texto en algún lugar, la primera. Si quieres enviarle el documento a alguien, la segunda.
Escanear documento o OCR PDF. Escanear documento parte de fotografías y produce un PDF. OCR PDF parte de un PDF que ya existe y le agrega una capa de texto. Ninguna cambia el aspecto de las páginas. Si fotografías un contrato, te conviene la primera; si recibes un escaneo por correo, la segunda.
Reconocer letra manuscrita o Imagen a texto. El mismo lector, con el buscador de tablas desactivado y con la cifra de confianza destacada como se merece, porque con la escritura a mano ese número es la parte útil del resultado. Si la letra es cursiva, ninguna de las dos páginas la leerá, y la de escritura a mano lo dice en lugar de devolver un disparate verosímil.
Lector de códigos QR o Lector de códigos de barras. Códigos cuadrados frente a códigos de barras, y vale la pena saber cuál tienes en la mano. La página de QR lee QR, Micro QR, Data Matrix, Aztec y PDF417, lo que incluye tarjetas de embarque y licencias de conducir, cuyos códigos son de formato cuadrado aunque parezcan una mancha de puntos. La página de códigos de barras lee los formatos de barras del comercio y la logística —EAN, UPC, Code 128, Code 39, ITF— y comprueba el dígito de control, el último dígito, calculado a partir de los demás, que marca la diferencia entre un número en el que puedes confiar y uno que solo parece correcto. Ninguno de los dos es OCR: un código es un símbolo con una geometría conocida, así que decodificarlo es aritmética, no una suposición sobre formas de letras. También fallan de forma distinta. Los códigos cuadrados llevan corrección de errores y sobreviven a un rayón o a un logo impreso en el centro; los de barras no llevan ninguna, así que un reflejo sobre las barras significa que no hay lectura, no un número equivocado.