Aller au contenu

Rendre un PDF scanné interrogeable

Lisez les mots d'un scan et posez-les de façon invisible sur les pages. Le document reste le même — il devient simplement interrogeable, sélectionnable et copiable. Les pages numérisées de travers ou sur le côté sont redressées.

  • Jamais conservé
  • Pas de file d'attente, pas d'attente
  • Sans inscription, sans filigrane

Comment ça marche

1

Ajoutez votre PDF scanné

Déposez le fichier. L'outil vérifie s'il possède déjà une couche de texte et vous prévient si l'OCR serait un retour en arrière.

2

Vérifiez la langue

L'outil lit la première page et vous indique la langue détectée. Plus de 120 langues sont disponibles si vous devez la choisir vous-même.

3

Téléchargez

Vous obtenez le même document, désormais doté d'une couche de texte cachée derrière le scan.

Une couche invisible sur une page inchangée

Le scan est conservé exactement tel quel. Ce qui est ajouté, c'est une couche de texte dessinée dans un mode de rendu invisible — de vrais caractères, positionnés mot par mot sur les mots de l'image, marqués pour ne jamais être peints. La page a l'air identique parce que visuellement rien n'a changé ; sélectionnez une phrase et la surbrillance tombe sur les bons mots, parce que le texte invisible se trouve là où est l'encre visible. C'est la méthode standard pour produire un scan interrogeable, et c'est pourquoi le résultat peut être recherché, copié et indexé tout en restant la photo d'un document.

Deux aspects de la page sont délibérément corrigés, parce que la lecture en avait besoin de toute façon. Une page numérisée sur le côté est remise à l'endroit, et une page passée de travers dans le chargeur est redressée — le résultat est donc souvent plus net que l'original. Les dimensions des pages sont reprises du PDF d'origine au lieu d'être uniformisées : un document aux formats de page mélangés le reste, et rien n'est remis à l'échelle.

La précision dépend presque entièrement du scan, et les écarts sont considérables. Un scan propre à 300 DPI d'un texte imprimé se lit avec une très grande précision ; la même page à 150 DPI se lit nettement moins bien ; une photo prise en biais sous un mauvais éclairage, c'est une tout autre histoire. Si vous maîtrisez la numérisation, 300 DPI en niveaux de gris est le réglage qui compte — une résolution plus élevée aide rarement, et une résolution plus faible pénalise immédiatement. Petits caractères, interlignes serrés, fonds colorés, photocopies de photocopies et tout ce qui est tamponné ou manuscrit posent des difficultés qu'aucun logiciel ne résout entièrement.

Ce qui est volontairement laissé de côté compte autant que ce qui est ajouté. Photos, logos, signatures et éléments décoratifs sont ignorés plutôt que lus, car forcer des lettres à sortir d'une image produit un charabia plausible qui apparaît ensuite dans chaque recherche. Les mots en chinois, japonais et coréen sont reconnus mais exclus de la couche de texte et comptés pour vous, plutôt qu'écrits comme des blancs, jusqu'à l'arrivée d'une police capable de les porter. Rien ici ne recompose le document : les mots de la page restent une image, et la conversion en Word est l'outil qui les transforme en texte modifiable.

Si vous cherchez autre chose

OCRmyPDF est l'outil à côté duquel cette page n'est qu'une commodité, et il est gratuit. ocrmypdf --deskew --rotate-pages in.pdf out.pdf fait le même travail avec plus de contrôle, et vous pouvez ajouter --optimize 3 pour alléger le résultat, --redo-ocr pour remplacer une mauvaise couche existante, et --output-type pdfa pour produire un fichier d'archivage dans la même passe. Il gère des milliers de pages, fonctionne avec un dossier surveillé, et c'est ce qu'utilisent réellement les bibliothèques et les services d'archives.

Pour les documents difficiles — imprimés anciens, mises en page inhabituelles, tableaux chargés — un service hébergé de Google, Amazon ou Microsoft lira des pages que la reconnaissance généraliste ne sait pas lire, parce qu'il a été entraîné sur bien plus de données. C'est une vraie différence de capacité, et elle mérite d'être connue. Mais cela implique aussi d'envoyer vos documents à un tiers, ce qui est précisément le compromis que cette page existe pour éviter — c'est donc le bon choix pour un vieux livre fragile, et le mauvais pour un carton de dossiers médicaux.

Questions fréquentes

Les pages auront-elles un aspect différent ensuite ?

Seulement plus droit : une page numérisée avec un léger angle ou sur le côté est redressée. Le scan lui-même est conservé et les mots reconnus sont placés par-dessus à l'encre invisible — jamais peints, jamais imprimés. Ce qui change, c'est que Ctrl+F se met à trouver des choses.

Mon document est-il conservé quelque part ?

Non. La reconnaissance ne conserve rien. Le moteur de lecture et le pack de langue proviennent de ce site la première fois que vous utilisez une langue ; le document lui-même ne quitte jamais l'appareil.

Quelle est la précision ?

Très bonne sur des scans nets de texte imprimé. Les photos floues, l'écriture manuscrite et les polices inhabituelles la réduisent ; l'inclinaison est corrigée avant la lecture. Les tableaux à bordures sont lus cellule par cellule, pour que les libellés d'un formulaire ne se mélangent pas à leurs valeurs.

Quelles langues fonctionnent ?

Plus de 120, dont l'anglais, le bengali, l'hindi, l'ourdou, l'arabe, l'espagnol, le français, le chinois, le japonais et le coréen. L'écriture est détectée sur la page ; lorsque plusieurs langues partagent la même écriture, la langue de votre navigateur sert à trancher, et vous pouvez la changer.

Certains mots manquent dans la couche de texte. Pourquoi ?

La couche de texte ne peut contenir que des caractères qu'une police fournie sait écrire. Le bengali, le devanagari, l'arabe, le thaï et deux douzaines d'autres écritures ont ici leur propre police ; le chinois, le japonais et le coréen n'en ont pas encore, donc ces mots sont comptés pour vous plutôt qu'enregistrés comme des blancs. PDF en Word avec OCR vous donne ce texte en entier.

Combien de temps cela prend-il ?

Quelques secondes par page, car c'est votre propre appareil qui fait la lecture, et non une batterie de serveurs. La progression s'affiche page par page.

Bon à savoir : Les mots en chinois, japonais et coréen sont exclus de la couche de texte et comptés pour vous, plutôt qu'enregistrés comme des blancs, jusqu'à l'arrivée d'une police adaptée ; toutes les autres écritures reconnues sont écrites. Photos, logos et signatures sont ignorés pour ne jamais devenir du texte absurde. Aucun outil d'OCR généraliste ne reconnaît l'écriture manuscrite de façon fiable.

Intégrez cet outil à votre site

Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.