Saltar al contenido

Hacer que un PDF escaneado permita buscar texto

Lee las palabras de un escaneo y las coloca de forma invisible sobre las páginas. El documento se ve igual: simplemente ahora puedes buscar, seleccionar y copiar su texto. Las páginas escaneadas torcidas o de lado se enderezan.

  • Nunca se guarda
  • Sin filas ni esperas
  • Sin registro, sin marca de agua

Cómo funciona

1

Agrega tu PDF escaneado

Suelta el archivo. La herramienta comprueba si ya tiene una capa de texto y te avisa si el OCR sería un paso atrás.

2

Revisa el idioma

La herramienta lee la primera página y te dice qué idioma encontró. Hay más de 120 disponibles si necesitas elegir uno tú.

3

Descarga

Obtienes el mismo documento, ahora con una capa de texto oculta detrás del escaneo.

Una capa invisible sobre una página sin cambios

El escaneo se conserva exactamente como estaba. Lo que se agrega es una capa de texto dibujada en un modo de representación invisible: caracteres reales, colocados palabra por palabra sobre las palabras de la imagen y marcados para que nunca se pinten. La página se ve idéntica porque visualmente no cambió nada; selecciona una oración y el resaltado cae sobre las palabras correctas porque el texto invisible está donde está la tinta visible. Esta es la forma estándar de crear un escaneo con texto buscable, y por eso el resultado se puede buscar, copiar e indexar sin dejar de ser una fotografía de un documento.

Dos aspectos de la página se corrigen a propósito, porque la lectura los necesitaba de todos modos. Una página escaneada de lado se pone derecha, y una página que pasó torcida por el alimentador se endereza; por eso el resultado a menudo queda más ordenado que el original. Los tamaños de página se mantienen como en el PDF original en lugar de unificarse, así que un documento con páginas de distintos tamaños sigue igual y no se reescala nada.

La precisión depende casi por completo del escaneo, y las diferencias son enormes. Un escaneo limpio a 300 DPI de texto impreso se lee con una precisión muy alta; la misma página a 150 DPI se lee notablemente peor; una foto tomada en ángulo y con poca luz es otra historia. Si tú controlas el escaneo, 300 DPI en escala de grises es la configuración que importa: más resolución rara vez ayuda, y menos perjudica de inmediato. La letra pequeña, el interlineado apretado, los fondos de color, las fotocopias de fotocopias y todo lo sellado o escrito a mano son más difíciles de maneras que ningún software resuelve del todo.

Lo que se deja fuera a propósito es tan importante como lo que se incluye. Las fotografías, los logos, las firmas y los gráficos decorativos se ignoran en lugar de leerse, porque forzar letras a partir de una imagen produce disparates verosímiles que luego aparecen en cada búsqueda. Las palabras en chino, japonés y coreano se reconocen, pero se dejan fuera de la capa de texto y se cuentan para informarte, en lugar de escribirse en blanco, hasta que se incluya una fuente que pueda representarlas. Nada de esto vuelve a componer el documento: las palabras de la página siguen siendo una imagen, y convertir a Word es la herramienta para convertirlas en texto editable.

Si buscas otra cosa

OCRmyPDF es la herramienta junto a la cual esta página es solo una comodidad, y es gratuita. ocrmypdf --deskew --rotate-pages in.pdf out.pdf hace el mismo trabajo con más control, y admite --optimize 3 para reducir el resultado, --redo-ocr para reemplazar una capa existente defectuosa y --output-type pdfa para producir un archivo de conservación en la misma pasada. Maneja miles de páginas, funciona vigilando una carpeta y es lo que realmente usan las bibliotecas y los archivos documentales.

Para material difícil (impresos históricos, diseños poco comunes, tablas complejas), un servicio en la nube de Google, Amazon o Microsoft leerá páginas que el reconocimiento de uso general no puede, porque está entrenado con muchísimo más material. Es una diferencia real de capacidad y conviene saberlo. También implica enviar tus documentos a un tercero, que es justo lo que esta página existe para evitar; así que es la opción adecuada para un libro antiguo y frágil, y la equivocada para una caja de historiales médicos.

Preguntas frecuentes

¿Las páginas se verán diferentes después?

Solo más derechas: una página escaneada un grado torcida o de lado se endereza. El escaneo en sí se conserva y las palabras reconocidas se colocan encima con tinta invisible: nunca se pintan ni se imprimen. Lo que cambia es que Ctrl+F empieza a encontrar cosas.

¿Se guarda mi documento en algún lugar?

No. El reconocimiento no guarda nada. El lector y el paquete de idioma se descargan de este sitio la primera vez que usas un idioma; el documento en sí nunca sale de tu dispositivo.

¿Qué tan preciso es?

Con escaneos limpios de texto impreso, muy preciso. Las fotos borrosas, la letra manuscrita y las fuentes poco comunes lo reducen; la inclinación se corrige antes de leer. Las tablas con líneas se leen celda por celda, así que las etiquetas de un formulario no se mezclan con sus valores.

¿Qué idiomas funcionan?

Más de 120, entre ellos inglés, bengalí, hindi, urdu, árabe, español, francés, chino, japonés y coreano. La escritura se detecta a partir de la página; cuando varios idiomas comparten escritura, se usa el idioma de tu navegador para desempatar, y puedes cambiarlo.

Faltan algunas palabras en la capa de texto. ¿Por qué?

La capa de texto solo puede contener caracteres que una fuente incluida sepa escribir. El bengalí, el devanagari, el árabe, el tailandés y otras dos docenas de escrituras tienen aquí su propia fuente; el chino, el japonés y el coreano todavía no, así que esas palabras se cuentan y se te informa, en lugar de guardarse en blanco. PDF a Word con OCR te da ese texto completo.

¿Cuánto tarda?

Unos segundos por página, porque la lectura la hace tu propio dispositivo y no una granja de servidores. El progreso se muestra página por página.

Conviene saber: Las palabras en chino, japonés y coreano se dejan fuera de la capa de texto y se cuentan para informarte, en lugar de guardarse en blanco, hasta que se incluya una fuente para ellas; todas las demás escrituras que el lector conoce se escriben. Las imágenes, logos y firmas se ignoran para que nunca se conviertan en texto sin sentido. Ninguna herramienta de OCR general reconoce la letra manuscrita de forma fiable.

Agrega esta herramienta a tu sitio web

Gratis para cualquier blog, página de clase o artículo de ayuda. Pega un fragmento de código y tus visitantes podrán usarla directamente en tu página.