Convertir un PDF en texte
Récupérez les mots d'un PDF avec ses lignes et ses paragraphes intacts — copiez-les directement dans le presse-papiers ou téléchargez un fichier .txt. Rien n'est conservé.
- Jamais conservé
- Pas de file d'attente, pas d'attente
- Sans inscription, sans filigrane
Comment ça marche
Ajoutez votre PDF
Déposez le PDF sur la page. L'extraction démarre aussitôt, page par page.
Relisez et ajustez
Le texte s'affiche dans une zone modifiable. Activez ou désactivez les marqueurs de saut de page, et corrigez ce que vous voulez avant d'enregistrer.
Copiez ou téléchargez
Copiez tout dans le presse-papiers, ou téléchargez le texte en fichier .txt.
D'où viennent les mots, et dans quel ordre ils arrivent
Les caractères d'un PDF ne sont pas stockés sous forme de texte. Ce sont des numéros de glyphes qui pointent vers une police incorporée, et les retransformer en lettres dépend d'une table, dans le fichier, qui indique quel caractère représente chaque glyphe. La plupart des logiciels l'incluent. Quand ce n'est pas le cas — les sous-ensembles de polices réduits produits par certains logiciels de PAO sont les coupables habituels —, la page s'affiche parfaitement à l'écran mais s'extrait en charabia, parce que l'information nécessaire pour la lire n'a jamais été écrite. Aucun extracteur ne peut y remédier : ce sont des données manquantes, pas un problème difficile.
L'ordre de lecture est ce qu'il faut vérifier avant de se fier au résultat. Le texte sort dans l'ordre où la page le dessine, c'est-à-dire l'ordre dans lequel le logiciel qui a créé le PDF l'a émis — et ce n'est souvent pas l'ordre dans lequel une personne lit. Une page à deux colonnes s'extrait souvent en colonne gauche puis colonne droite, correctement séparées, ou en lignes entremêlées entre les deux, selon la seule façon dont elle a été générée. En-têtes, pieds de page, numéros de page et encadrés atterrissent là où ils ont été dessinés, généralement au milieu du texte courant.
Quelques petits artefacts valent la peine d'être reconnus plutôt que de laisser perplexe. Les ligatures arrivent sous la forme du caractère unique que la police a réellement utilisé : « fin » peut donc arriver avec un seul glyphe au lieu d'un f suivi d'un i, et une recherche naïve de « fin » ne le trouve pas. Les mots coupés par un trait d'union en fin de ligne restent coupés, parce que la coupure existe réellement dans le fichier. Et les guillemets droits sont souvent des guillemets courbes, ce qui compte si le texte doit finir dans du code ou un CSV.
Une page scannée ne donne rien du tout, et l'outil le dit plutôt que de renvoyer un fichier vide — une photo de document ne contient aucun caractère, seulement des pixels. Il en va de même pour un texte vectorisé, ce que les graphistes font délibérément pour qu'un fichier s'imprime à l'identique partout : c'est alors véritablement une illustration. Dans les deux cas, il faut de l'OCR plutôt qu'une extraction.
Si vous cherchez autre chose
Quand les colonnes comptent, pdftotext -layout in.pdf out.txt de Poppler fait mieux que tout ce qu'un navigateur peut faire : il reconstruit l'espacement visuel avec de vrais blancs, si bien que les colonnes restent des colonnes et qu'un tableau reste un tableau lisible. pdftotext -raw fait l'inverse et livre l'ordre de dessin tel quel, ce qui est parfois exactement ce qu'un script attend.
Pour extraire le texte de centaines de fichiers, mutool draw -F txt et la bibliothèque Python pdfplumber sont les bonnes bases — pdfplumber en particulier vous donne chaque caractère avec ses coordonnées, sa police et sa taille, pour filtrer l'en-tête et le pied de page selon leur position plutôt qu'au jugé. C'est le travail que cette page ne peut pas faire, et c'est celui qui compte à grande échelle.
Questions fréquentes
Les paragraphes et les retours à la ligne sont-ils conservés ?
Oui. Un PDF ne contient aucun paragraphe — seulement des caractères placés à des coordonnées —, donc le texte est reconstruit en regroupant les mots qui partagent une même ligne de base et en ouvrant un nouveau paragraphe là où l'écart vertical se creuse. Le résultat se lit comme l'original, et non comme un bloc continu.
Mon PDF est-il conservé quelque part ?
Non. Le texte est lu par votre propre navigateur et n'est envoyé nulle part. Une fois la page chargée, vous pouvez même vous déconnecter d'Internet : l'outil fonctionne toujours.
L'outil indique que mon PDF ne contient pas de texte — pourquoi ?
Parce qu'il s'agit d'un scan ou d'une photo : la page est une image, et une image ne contient aucun texte à extraire. Utilisez OCR PDF, qui lit les mots directement dans l'image.
Puis-je modifier le texte avant de le télécharger ?
Oui — la zone est entièrement modifiable, et ce que vous voyez est exactement ce qui sera enregistré.
Et les tableaux et les colonnes ?
Les colonnes sont lues dans l'ordre où le PDF les dessine, ce qui est généralement correct mais peut entremêler les lignes sur des mises en page complexes à plusieurs colonnes. Les tableaux ressortent sous forme de lignes de texte, pas de grille — pour les tableaux, utilisez PDF en Excel.
Bon à savoir : Le texte brut ne porte aucune mise en forme : gras, tailles, couleurs, images et structure des tableaux disparaissent par définition. Un texte dessiné sous forme de contours vectoriels plutôt qu'en vrais caractères (fréquent dans les logos et certains PDF de graphistes) ne peut être extrait par aucun outil sans OCR.
Intégrez cet outil à votre site
Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.