Saltar al contenido

Por qué no puedes buscar en un PDF escaneado

Porque no hay palabras en él. Entender qué hay realmente en el archivo explica cada síntoma y señala el único ajuste que decide qué tan bien se puede arreglar.

Última revisión:

No hay palabras en el archivo

Un PDF puede contener dos cosas completamente distintas que se ven idénticas en pantalla. Un documento exportado desde Word contiene texto: caracteres reales, cada uno con una posición y una fuente, y por eso puedes seleccionar una oración, buscar un nombre y copiar un párrafo. Un documento escaneado contiene una fotografía de una página. No hay nada más que píxeles, exactamente igual que en la fotografía de una señal de tránsito.

Cada síntoma se desprende de ese único hecho. La búsqueda no encuentra nada porque no hay nada con qué coincidir. Seleccionar texto no funciona porque no hay texto que seleccionar: el cursor dibuja un rectángulo sobre una imagen. Copiar no te da nada. El archivo pesa mucho para su extensión, porque las imágenes son pesadas y las palabras no. Y al convertirlo a Word obtienes un documento vacío o una imagen pegada dentro de uno.

La prueba rápida: intenta seleccionar una sola palabra con el mouse. Si aparece un cursor de texto y la palabra se resalta, hay texto real. Si aparece un recuadro, es una imagen.

Lo que el OCR realmente agrega

El reconocimiento óptico de caracteres lee las formas de la imagen y determina qué letras son. Lo útil es lo que pasa después: las palabras reconocidas se escriben de vuelta en el PDF como texto invisible, colocado sobre las palabras de la imagen. La página se ve exactamente igual que antes, porque visualmente no cambió nada, pero ahora se puede buscar, seleccionar, copiar e indexar.

Es un diseño deliberadamente conservador, y es el correcto para documentos. No se recompone nada, así que un contrato sigue viéndose como el contrato que se firmó, y el escaneo original sigue siendo el registro visual. Hacer que un PDF escaneado permita buscar texto lo hace en una sola pasada, y normalmente también endereza y gira las páginas, porque la lectura lo necesitaba de todos modos.

Si lo que quieres es un documento editable y no solo con búsqueda, es un trabajo distinto y mucho más difícil: hay que extraer el texto, deducir el diseño y reconstruir el resultado como párrafos y tablas. Convertir a Word hace eso, y el resultado siempre hay que revisarlo, algo que una capa de texto no requiere.

El ajuste que lo decide todo: 300 DPI

La precisión del reconocimiento depende mucho más del escaneo que del software, y el número más importante es la resolución. 300 DPI es el estándar, y no es arbitrario: da unos 30 píxeles de altura al texto normal, holgadamente más que el mínimo necesario para distinguir letras de forma parecida.

A 150 DPI la precisión baja de forma notable, y los errores son de los traicioneros: un 1 leído como l, un 5 como S, rn como m. Por debajo de eso se degrada rápido. Subir de 300 rara vez ayuda y hace los archivos mucho más pesados: 600 DPI solo vale la pena para letra muy pequeña u originales en mal estado.

Otros tres ajustes de captura importan casi lo mismo. Escala de grises en lugar de blanco y negro, porque un umbral estricto destruye las partes finas de las letras. Plano y alineado con el sensor, porque en una página fotografiada en ángulo las letras cambian de forma a lo largo de la página. Y con iluminación uniforme: el fallo clásico es tu propia sombra sobre la página que fotografías desde arriba.

Lo que ningún OCR va a leer

Ser honesto con esto ahorra mucho tiempo. La letra cursiva no la reconoce el OCR de uso general, y el motivo es estructural, no de esfuerzo: leer letra impresa funciona encontrando los límites entre letras, y en la cursiva no los hay. Las letras de molde escritas a mano, las mayúsculas y las casillas de formularios suelen funcionar bien, porque son formas separadas con espacios entre ellas.

El texto que forma parte de una fotografía (palabras en un letrero, en un producto, sobre un fondo recargado) es mucho más difícil que el texto en papel, y las letras muy estilizadas o decorativas lo son todavía más. Las fotocopias de fotocopias pierden los trazos finos que distinguen unas letras de otras. Y un documento con sellos, anotaciones o resaltados se lee peor allí donde las marcas se superponen al texto.

Una buena herramienta te dice qué tan segura estaba, y ese dato está para usarse. Una confianza baja en medio de una oración que puedes entender por el contexto importa mucho menos que una confianza baja en un dígito de un número de cuenta. Los errores peligrosos son los que se cometen con seguridad, porque nada los señala.

Por qué esto importa más allá de la comodidad

Un archivo escaneado sin capa de texto está, a efectos prácticos, perdido. Nada puede buscar en él, nada puede indexarlo, ningún sistema de cumplimiento puede encontrar un nombre en él y ningún lector de pantalla puede leerlo en voz alta, lo que en muchas jurisdicciones convierte su publicación en un problema legal y no en una simple molestia.

Por eso también vale la pena insistir en escanear con los ajustes correctos desde la primera vez. Volver a escanear una caja de documentos cuesta mucho más que escanearla bien una sola vez, y ningún procesamiento recupera detalles que nunca se capturaron.

Preguntas frecuentes

¿Qué tan preciso es el OCR, de verdad?

Con un escaneo limpio a 300 DPI de texto impreso normal, muy preciso: lo suficiente como para que los errores sean ocasionales y no habituales. Con una foto de celular tomada en ángulo y con poca luz, muchísimo peor. La calidad del escaneo importa mucho más que el software que elijas.

¿El OCR cambiará el aspecto de mi documento?

No. El texto reconocido se agrega de forma invisible sobre la imagen existente, así que la página se ve exactamente igual. Normalmente las páginas se enderezan y se ponen en posición vertical como parte del proceso, lo que hace que los escaneos torcidos se vean mejor, no distintos.

¿Puedo editar el texto después de aplicar OCR?

No en el propio PDF: la página visible sigue siendo una imagen, y la capa de texto está encima, invisible. Para obtener algo editable, convierte a Word el documento ya reconocido, y cuenta con tener que revisar el resultado.

¿El OCR funciona con letra manuscrita?

Las letras de molde separadas y los formularios completados a mano suelen funcionar. La letra cursiva no, en ninguna herramienta de OCR de uso general: las letras se unen sin límites que encontrar. Las herramientas entrenadas específicamente con escritura a mano lo hacen mejor, a costa de enviar tus páginas a un tercero.

¿Por qué mi PDF con búsqueda pesa tanto más?

Apenas debería cambiar: una capa de texto ocupa unos pocos kilobytes por página. Si creció mucho, probablemente las páginas se volvieron a renderizar en lugar de conservarse, algo que conviene revisar, ya que la gracia de una capa de texto es que la imagen original se conserva intacta.