Aller au contenu

Pourquoi la recherche ne marche pas dans un PDF scanné

Parce qu'il ne contient aucun mot. Comprendre ce que contient vraiment le fichier explique tous les symptômes, et désigne le réglage qui décide de la qualité de la correction.

Dernière relecture :

Le fichier ne contient aucun mot

Un PDF peut contenir deux choses totalement différentes qui ont exactement la même apparence à l'écran. Un document exporté depuis Word contient du texte — de vrais caractères, chacun avec une position et une police —, c'est pourquoi vous pouvez sélectionner une phrase, chercher un nom et copier un paragraphe. Un document scanné contient une photo de page. Il n'y a rien d'autre dedans que des pixels, exactement comme il n'y a que des pixels dans la photo d'un panneau routier.

Tous les symptômes découlent de ce seul fait. La recherche ne trouve rien, car il n'y a rien à trouver. La sélection de texte ne fonctionne pas, car il n'y a pas de texte à sélectionner — le curseur dessine un rectangle sur une image. La copie ne donne rien. Le fichier est lourd pour sa longueur, car les images pèsent lourd et les mots presque rien. Et le convertir en Word produit soit un document vide, soit une image collée dans un document.

Le test rapide : essayez de sélectionner un seul mot avec la souris. Si vous obtenez un curseur de texte et un mot surligné, il y a du vrai texte. Si vous obtenez un cadre, c'est une image.

Ce qu'apporte vraiment l'OCR

La reconnaissance optique de caractères lit les formes de l'image et en déduit de quelles lettres il s'agit. Le plus utile vient ensuite : les mots reconnus sont réécrits dans le PDF sous forme de texte invisible, placé par-dessus les mots de l'image. La page a exactement le même aspect qu'avant, puisque visuellement rien n'a changé — mais elle peut désormais être interrogée, sélectionnée, copiée et indexée.

C'est une conception volontairement prudente, et c'est la bonne pour des documents. Rien n'est recomposé : un contrat ressemble toujours au contrat qui a été signé, et le scan d'origine reste la trace visuelle. Rendre un PDF scanné interrogeable fait cela en un seul passage, et redresse et fait pivoter les pages au passage, puisque la lecture l'exigeait de toute façon.

Si vous voulez un document modifiable plutôt qu'interrogeable, c'est un travail différent et bien plus difficile : il faut extraire le texte, déduire la mise en page et reconstruire le résultat en paragraphes et en tableaux. La conversion en Word s'en charge, et le résultat doit toujours être vérifié, ce qui n'est pas le cas d'une couche de texte.

Le réglage qui décide de tout : 300 DPI

La précision de la reconnaissance dépend bien plus du scan que du logiciel, et le chiffre le plus important est la résolution. 300 DPI est la norme, et ce n'est pas un hasard — cela donne environ 30 pixels de hauteur à un texte courant, nettement plus que le minimum nécessaire pour distinguer des lettres de forme proche.

À 150 DPI, la précision baisse sensiblement, et les erreurs sont du genre insidieux : un 1 lu comme un l, un 5 comme un S, rn comme m. En dessous, la qualité s'effondre vite. Monter au-delà de 300 aide rarement et alourdit beaucoup les fichiers — 600 DPI ne se justifie que pour les très petits caractères ou les originaux de mauvaise qualité.

Trois autres réglages de capture comptent presque autant. Des niveaux de gris plutôt que du noir et blanc, car un seuil tranché détruit les parties fines des lettres. À plat et bien en face du capteur, car sur une page photographiée de biais, les lettres changent de forme d'un bout à l'autre. Et un éclairage uniforme — l'échec classique, c'est votre propre ombre sur la page que vous photographiez d'en haut.

Ce qu'aucun OCR ne lira

Être honnête sur ce point fait gagner beaucoup de temps. L'écriture cursive liée n'est pas reconnue par un OCR généraliste, et la raison est structurelle, pas une question d'effort : la lecture de l'imprimé consiste à trouver les frontières entre les lettres, et en cursive il n'y en a pas. Les lettres écrites à la main en script, les capitales d'imprimerie et les cases de formulaire fonctionnent souvent bien, car ce sont des formes distinctes séparées par des espaces.

Le texte qui fait partie d'une photo — des mots sur un panneau, sur un produit, sur un fond chargé — est bien plus difficile que du texte sur papier, et les lettrages très stylisés ou décoratifs le sont plus encore. Les photocopies de photocopies perdent les traits fins qui distinguent les lettres. Et un document tamponné, annoté ou surligné se lit moins bien partout où ces marques recouvrent le texte.

Un bon outil indique son niveau de confiance, et ce chiffre est fait pour être utilisé. Une confiance faible au milieu d'une phrase que vous comprenez grâce au contexte compte bien moins qu'une confiance faible sur un chiffre d'un numéro de compte. Les erreurs dangereuses sont celles commises avec assurance, car rien ne les signale.

Pourquoi l'enjeu dépasse le simple confort

Une archive scannée sans couche de texte est, en pratique, perdue. Rien ne peut la fouiller, rien ne peut l'indexer, aucun système de conformité ne peut y retrouver un nom, et aucun lecteur d'écran ne peut la lire à voix haute — ce qui, dans de nombreux pays, fait de sa publication un problème juridique plutôt qu'un simple désagrément.

C'est aussi pourquoi il vaut la peine d'exiger les bons réglages dès le premier scan. Renumériser un carton de documents coûte bien plus cher que de le numériser correctement une seule fois, et aucun traitement ne récupère un détail qui n'a jamais été capturé.

Questions fréquentes

L'OCR est-il vraiment précis ?

Sur un scan propre à 300 DPI d'un texte imprimé ordinaire, très précis — assez pour que les erreurs soient occasionnelles et non systématiques. Sur une photo prise au téléphone, de biais et mal éclairée, nettement moins. La qualité du scan compte bien plus que le choix du logiciel.

L'OCR va-t-il modifier l'apparence de mon document ?

Non. Le texte reconnu est ajouté de façon invisible par-dessus l'image existante, donc la page a exactement le même aspect. Les pages sont en général redressées et remises à l'endroit au cours du traitement, ce qui rend les scans de travers plus beaux, pas différents.

Puis-je modifier le texte après l'OCR ?

Pas dans le PDF lui-même — la page visible reste une image, et la couche de texte se trouve, invisible, par-dessus. Pour obtenir un document modifiable, convertissez le document reconnu en Word, et prévoyez de vérifier le résultat.

L'OCR fonctionne-t-il sur l'écriture manuscrite ?

Les lettres manuscrites bien séparées et les formulaires remplis fonctionnent souvent. L'écriture cursive liée, non, avec aucun outil d'OCR généraliste — les lettres s'enchaînent sans frontières à trouver. Les outils entraînés spécifiquement sur l'écriture manuscrite font mieux, au prix de l'envoi de vos pages à un tiers.

Pourquoi mon PDF interrogeable est-il beaucoup plus lourd ?

Sa taille devrait à peine changer — une couche de texte pèse quelques kilo-octets par page. S'il a beaucoup grossi, les pages ont probablement été recalculées au lieu d'être conservées, ce qui mérite d'être vérifié, puisque tout l'intérêt d'une couche de texte est de préserver l'image d'origine intacte.