Aller au contenu

Convertir un PDF en Word

Transformez n'importe quel PDF en document Word modifiable — images comprises, avec un mode Aspect identique qui reproduit les pages d'origine, et une OCR intégrée pour les scans. Rien n'est conservé ; votre fichier n'est jamais gardé.

  • Jamais conservé
  • Pas de file d'attente, pas d'attente
  • Sans inscription, sans filigrane

Comment ça marche

1

Ajoutez votre PDF

Déposez un PDF sur la page. L'outil l'analyse automatiquement et active l'OCR s'il détecte un scan.

2

Choisissez le mode

Texte modifiable, le mode par défaut, vous donne un document Word normal, page pour page avec le PDF : paragraphes, titres, gras et italique, liens et images, chaque page à sa taille d'origine avec ses propres marges et son interlignage, de sorte que la page 12 du PDF est la page 12 du document — dans un fichier à peu près de la taille du PDF. Aspect identique fixe chaque ligne à sa place, par-dessus une image de la page — il reproduit le PDF pour l'impression, mais il est difficile à modifier et plusieurs fois plus lourd. Pour les scans, l'OCR s'active toute seule, détermine la langue à partir de la première page et redresse les pages numérisées de travers.

3

Convertissez et téléchargez

Cliquez sur Convertir en Word et téléchargez un .docx propre, avec titres et paragraphes, prêt à être modifié.

Ce qui se convertit proprement, et ce qui ne se convertit pas

Un PDF enregistre des glyphes à des coordonnées. Il n'a pas de paragraphes et, sauf si quelqu'un l'a délibérément balisé, pas de titres — les deux sont donc déduits plutôt que lus. Les mots qui partagent une ligne de base forment une ligne, un espace vertical plus grand ouvre un nouveau paragraphe, et une ligne courte composée à environ 1,6 fois la taille médiane du corps de texte devient un Titre 1, à 1,3 fois un Titre 2. Mieux vaut connaître cette dernière règle avant de commencer à modifier : un document dont les titres sont en gras mais pas plus grands que le corps de texte arrive sous forme de texte courant, et le volet de navigation de Word sera vide.

Les liens sont conservés, ce qui surprend. Une annotation de lien posée sur un texte devient un vrai lien hypertexte Word, et une entrée de sommaire ou un renvoi qui menait à la page douze devient un lien interne vers un signet placé en haut de cette page — une table des matières fonctionne donc toujours après la conversion.

Deux choses ne sont pas lues du tout. Les réponses d'un formulaire PDF rempli se trouvent dans des objets champs et non dans la page : en Texte modifiable, elles sont tout simplement absentes ; Aspect identique les affiche, car elles font partie de l'image de la page, mais pas sous forme de texte modifiable. Les commentaires et les tampons sont le même type d'objet et connaissent le même sort. Et en Aspect identique, les éléments graphiques sont rendus une seule fois à 144 DPI, avec le vrai texte placé par-dessus : un logo ou un graphique vectoriel dans le PDF devient une image dans le .docx, et l'agrandir le montre.

Si vous cherchez autre chose

Quand vous voulez les mots plutôt qu'un document Word, pdftotext -layout file.pdf de Poppler est plus rapide et plus prévisible, sépare les colonnes par des espaces, et c'est la façon habituelle de transmettre un PDF à un autre outil. Et si le PDF a été créé à partir d'un fichier Word, demandez le .docx à la personne qui l'a produit : toute conversion en sens inverse est une reconstruction à partir de coordonnées, et l'original est le seul exemplaire qui n'en soit pas une.

Les tableaux sont le point faible de tous les convertisseurs de PDF, celui-ci compris. Si un document est surtout composé de tableaux et que les chiffres comptent, Tabula et Camelot sont gratuits, conçus pour ce seul problème, et feront mieux qu'un convertisseur généraliste.

Questions fréquentes

Mon PDF est-il conservé pendant la conversion ?

Non. Aucun des deux modes de conversion ne conserve quoi que ce soit — votre fichier n'est jamais gardé. Avec l'OCR, le moteur de lecture et le pack de langue sont chargés depuis ce site la première fois ; votre document lui-même n'est jamais envoyé nulle part.

Peut-il convertir des PDF numérisés et des photos de documents ?

Oui. Activez l'OCR (l'outil le propose automatiquement quand il détecte un scan) et le texte est lu à partir des images des pages. La langue est détectée sur la page — plus de 120 sont prises en charge, dont l'anglais, le bengali, l'hindi, l'ourdou, l'arabe, l'espagnol et le chinois — et vous pouvez la choisir vous-même si la détection se trompe. En mode Texte modifiable, les formulaires à lignes tracées deviennent de vrais tableaux Word.

Quelle est la précision de l'OCR ?

Sur des scans propres de texte imprimé, la précision est très élevée. Elle baisse avec les photos floues, l'écriture manuscrite ou les polices inhabituelles. Des scans nets, droits et bien éclairés donnent les meilleurs résultats.

Ma mise en forme et mes images seront-elles conservées ?

Oui. Aspect identique garde chaque page à sa taille d'origine et la reconstruit en deux couches : chaque photo, logo, bandeau de couleur et élément vectoriel est reproduit exactement comme le PDF le dessine, et le vrai texte se place par-dessus, à sa position d'origine, avec les couleurs, le gras et les titres d'origine. Texte modifiable reconstruit plutôt des paragraphes et des titres propres, avec les images dans l'ordre de lecture, page pour page avec le PDF — le meilleur choix si vous comptez beaucoup modifier.

Quel format Word est produit ?

Un fichier .docx standard qui s'ouvre dans Microsoft Word, Google Docs, LibreOffice et tous les éditeurs modernes.

Y a-t-il une limite de pages ou de taille ?

Pas de limite fixe. L'OCR prend quelques secondes par page, car c'est votre propre appareil qui fait la lecture : les très longs scans prennent simplement plus de temps — un indicateur de progression montre exactement où en est le traitement.

Bon à savoir : Les polices sont remplacées par des équivalents proches, car les PDF intègrent leurs propres polices, que Word ne peut pas utiliser — Aspect identique est donc quasi identique et non identique au pixel près, et une ligne peut être légèrement plus large ou plus étroite que l'original. Dans les PDF texte, les tableaux sont convertis en texte positionné plutôt qu'en tableaux Word ; dans les scans, les tableaux à lignes tracées deviennent des tableaux Word, mais les autres restent du texte positionné. L'OCR ignore volontairement les photos, logos et éléments décoratifs pour qu'ils ne deviennent jamais des caractères parasites, laisse l'écriture manuscrite et les tampons sous forme d'images, et prend quelques secondes par page.

Intégrez cet outil à votre site

Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.