Ce que contient un document, et ce que chaque conversion en fait
Un .docx est un ZIP de fichiers XML, et l'essentiel de ce qui en fait un document n'est pas le texte. Il y a les styles — des définitions nommées comme Titre 1, partagées par de nombreux paragraphes — et la mise en forme directe, quand quelqu'un a sélectionné une ligne et appuyé sur Gras. Les deux se ressemblent à l'écran et se comportent de façon totalement différente à la conversion : un style survit en tant que style, un passage mis en forme directement ne survit que sous la forme de l'apparence qu'il produisait. À côté se trouvent les définitions de numérotation, les modifications suivies, les commentaires, les notes de bas de page, les en-têtes et pieds de page, les zones de texte, les polices incorporées et les propriétés du document, chacun stocké séparément du texte des paragraphes.
Les numéros de liste en sont l'exemple le plus parlant. Word ne stocke pas « 1. » sous forme de texte ; il stocke une référence à une définition de numérotation et calcule le numéro en dessinant la page. Les extracteurs de texte qui parcourent le XML des paragraphes perdent donc tous les numéros et vous rendent une liste sans numérotation. DOCX en TXT les reconstruit au contraire — « 1. », « 1.1 », « a) », « iii. » — y compris pour les listes qui recommencent ou se poursuivent au fil du document.
Modifications suivies et commentaires : un choix, pas un accident. Un document en cours de relecture contient à la fois le texte supprimé et le texte inséré, dans le même fichier, balisés. DOCX en TXT le lit comme si toutes les modifications avaient été acceptées : insertions conservées, suppressions écartées. Les commentaires ne sont pas inclus du tout, ce qui est généralement ce que l'on veut quand le texte brut est destiné à être rendu public. Les notes de bas de page et de fin apparaissent sous forme de repères [1], les notes étant regroupées à la fin ; les en-têtes et pieds de page peuvent être activés, et les zones de texte apparaissent une seule fois chacune, dans l'ordre de lecture, au lieu d'être répétées ou perdues.
Ce qu'une conversion en PDF fige, c'est la pagination. Dans un traitement de texte, l'endroit où se termine la page quatre est recalculé à chaque ouverture du fichier, avec les polices et le pilote d'imprimante de la personne qui l'ouvre — c'est pourquoi un document arrive chez le destinataire avec un tableau coupé sur deux pages, alors que ce n'est pas le cas chez vous. Un PDF ne fait pas ce recalcul : les sauts de page ont été décidés une fois pour toutes, à la conversion, et font désormais partie du fichier. Word en PDF, ODT en PDF et RTF en PDF obtiennent ces sauts d'une mise en page complète de traitement de texte, et non d'un navigateur qui en donne une approximation : c'est pourquoi zones de texte, formes, en-têtes et pieds de page tombent là où l'auteur les a placés.
Ce qu'elle fait perdre, c'est la possibilité de modifier et de réorganiser le texte. Les styles deviennent une mise en forme visuelle, le plan devient des signets, et le texte ne se réajuste plus à un écran de téléphone. Les polices incorporées dans le document sont utilisées telles quelles ; une police qui n'est ni incorporée ni disponible pour le convertisseur est remplacée par la police aux métriques compatibles la plus proche, si bien que les lignes se coupent toujours aux mêmes endroits, même si le dessin des lettres diffère.
Les livres numériques n'ont pas de pages à préserver. EPUB, MOBI et AZW3 sont des formats recomposables — l'application de lecture décide où se termine chaque page, selon la taille de police choisie —, donc « page 40 » n'est pas une propriété du livre, et la pagination de votre PDF est créée à la conversion, à partir du format de page et des marges que vous choisissez. Ce que contient le fichier, c'est la structure en chapitres et la table des matières, qui deviennent de vrais liens et signets PDF. L'AZW3 contient une feuille de style et souvent des polices incorporées : il ressort donc tel que l'éditeur l'a conçu. Les anciens fichiers MOBI n'ont aucune feuille de style, ce qui explique qu'un MOBI converti paraisse plus sobre que le même livre dans l'application Kindle — l'application ajoutait une typographie que le fichier n'a jamais contenue.
Le RTF, c'est du texte de bout en bout, et c'est pourquoi il traverse les décennies de logiciels. Son point faible, c'est l'encodage des caractères : le RTF est antérieur à Unicode et stocke le texte dans d'anciennes pages de codes — Europe centrale, cyrillique, grec, japonais —, d'où les caractères illisibles des RTF mal convertis. Ici, chacune est décodée correctement, tout comme le texte Unicode moderne.
Quand un navigateur n'est vraiment pas le bon outil
Certains de ces outils gardent votre fichier entièrement confidentiel, d'autres le confient à un serveur, et mieux vaut être précis sur lesquels. PDF en texte, TXT en PDF, DOCX en TXT, HTML en DOCX et Markdown en HTML n'envoient jamais rien : le fichier est lu, converti et écrit ici même, et rien ne sort. Word en PDF, ODT en PDF, RTF en PDF, HTML en PDF, Markdown en PDF et les trois convertisseurs de livres numériques font la conversion sur notre serveur, car reproduire la mise en page d'un traitement de texte, ou paginer correctement un livre, n'est pas quelque chose qu'une page web peut simuler. Ce qui est envoyé varie : les documents Word, ODT et RTF partent tels quels, tandis que les fichiers Markdown et les livres numériques sont d'abord décompressés et assemblés en page web, et c'est cette page assemblée qui est envoyée. Dans tous les cas, elle transite par une connexion chiffrée, est convertie, puis supprimée dès que votre téléchargement est prêt — rien n'est conservé, journalisé ni partagé. Chacun de ces outils se rabat aussi sur son propre convertisseur si le serveur est injoignable, vous prévient quand c'est le cas, et vous indique ce que la solution de repli n'a pas pu conserver.
Les formats que nous n'ouvrons pas. Les anciens fichiers binaires .doc de Word 97–2003 se convertissent sans problème avec Word en PDF, car le serveur les lit directement — mais DOCX en TXT, qui fonctionne dans le navigateur, ne le peut pas et demande un .docx. Pour les documents protégés par mot de passe, le mot de passe doit être retiré dans le programme qui l'a défini. Les livres Kindle protégés par DRM ne peuvent être ouverts par aucun convertisseur, où que ce soit — c'est tout l'objet de la protection —, pas plus que le format KFX, plus récent, d'Amazon, que seule l'application Kindle sait lire.
Le travail sur les longs documents. Documents maîtres, champs de renvoi, index, tables des références générées automatiquement, publipostage et gestionnaires de bibliographie sont des fonctions de traitement de texte, et un convertisseur n'est pas un traitement de texte. Installez LibreOffice : il est gratuit, il lit tous les formats de cette page, et pour ces tâches, c'est tout simplement le bon programme.
Les lots et l'automatisation. Ces outils fonctionnent quand une personne clique. Convertir un millier de fichiers selon un planning est un travail pour la ligne de commande, et les outils gratuits sont excellents : LibreOffice en mode headless convertit tout ce que Writer sait ouvrir, Pandoc passe du Markdown au HTML, au DOCX, au LaTeX et à une douzaine d'autres formats avec plus de contrôle que n'importe quel formulaire web, et Calibre traite les livres numériques en masse et convertit entre tous les formats de livres numériques non protégés qui existent.
Une mise en page fidèle dans l'autre sens. Retransformer un PDF très travaillé en document modifiable est un problème de déduction, pas une conversion, et rien ne le fait parfaitement — ni nous, ni les logiciels de bureau hors de prix. Si le document d'origine existe encore, modifiez-le.
Choisir entre des outils aux noms proches
Markdown en PDF ou Markdown en HTML. Le même analyseur, une destination différente. Markdown en PDF vous donne un document paginé avec la police, le format de page et les marges de votre choix, des titres transformés en signets PDF et une table des matières qui renvoie à la bonne page — pour imprimer, joindre ou archiver. Markdown en HTML vous donne soit une page autonome mise en forme, soit un simple extrait à coller dans un CMS — pour publier. Pour obtenir du Markdown dans Word, passez par Markdown en HTML, puis par HTML en DOCX.
Word en PDF, ODT en PDF ou RTF en PDF. La même conversion en coulisses ; seul change ce que vous leur donnez. Word en PDF pour les .docx. ODT en PDF pour tout ce qui vient de LibreOffice, d'OpenOffice ou d'un export Google Docs « Télécharger au format OpenDocument ». RTF en PDF pour WordPad, TextEdit et les lettres et rapports que produisent encore les logiciels de gestion. Choisir la page qui correspond à votre extension compte moins qu'on ne le croit — ce qui compte, c'est qu'aucune d'elles n'est TXT en PDF, qui n'a de toute façon aucune mise en forme à préserver.
TXT en PDF ou Markdown en PDF. TXT en PDF met votre texte en page comme du texte : une seule police, vos marges, aucune interprétation. Markdown en PDF lit les # et les * comme des instructions et produit titres, listes, tableaux, code coloré et plan en signets. Donnez un fichier Markdown à TXT en PDF, et vous obtiendrez un PDF plein d'astérisques.
EPUB, MOBI et AZW3 en PDF. Les trois acceptent plus de formats que leur nom ne le laisse penser, donc n'importe lequel ouvrira votre fichier ; les pages diffèrent parce que les livres diffèrent. L'EPUB et l'AZW3 (KF8) contiennent des feuilles de style et souvent des polices incorporées, et ressortent avec une vraie mise en page. Le MOBI est l'ancien conteneur, à la mise en forme minimale, et son PDF converti est volontairement sobre. Si un fichier Kindle contient les deux mises en page, c'est la plus récente qui est utilisée.
HTML en DOCX ou Markdown en HTML. HTML en DOCX commence par mettre en page le balisage : le CSS appliqué — polices, tailles, couleurs, espacements, bordures — est donc écrit dans le document sous forme de vraie mise en forme Word, avec les styles de titre de Word, de vraies listes et de vrais tableaux plutôt que des blocs figés en place. Markdown en HTML, lui, produit le balisage. Aucun des deux n'exécute jamais de JavaScript.
DOCX en TXT ou PDF en texte. Les deux vous rendent du texte brut, mais lisent des choses très différentes. Un .docx sait encore ce qu'est un paragraphe, une liste ou un tableau : DOCX en TXT peut donc reconstruire les numéros de liste et garder les lignes de tableau ensemble. Un PDF sait seulement où chaque caractère a été dessiné : PDF en texte déduit donc les lignes et les paragraphes de leur position — avec de bons résultats, mais jamais aussi fidèles à la structure. Si vous avez à la fois le document d'origine et son PDF, extrayez le texte du document.
DOCX en TXT ou « Enregistrer en .txt » dans Word. L'export en texte brut de Word perd la numérotation des listes, abîme les tableaux et a ses propres idées sur l'encodage. DOCX en TXT reconstruit la numérotation, écrit les tableaux soit en lignes séparées par des tabulations qui se collent dans un tableur, soit en colonnes alignées qui restent alignées même en chinois et en japonais, et enregistre en UTF-8 avec les fins de ligne de votre choix.