Aller au contenu

Des outils document qui conservent la mise en forme

Neuf outils pour vos documents, CV et livres numériques, gratuits et sans inscription. Cinq d'entre eux envoient le fichier à notre serveur, qui le supprime dès que votre téléchargement est prêt, et chacun l'indique sur sa propre page.

9 outils, sans inscription, sans filigrane

Pour envoyer un document en PDF, Word en PDF prend en charge les .docx, ODT en PDF et RTF en PDF s'occupent de ce qu'écrivent les autres traitements de texte, et Markdown en PDF transforme un README en document soigneusement mis en page. Pour un livre qui vous appartient : EPUB en PDF, MOBI en PDF et AZW3 en PDF. Dans l'autre sens — récupérer le texte d'un fichier Word ou d'un PDF, ou transformer une page web en document modifiable —, DOCX en TXT, PDF en texte et HTML en DOCX le font sans que le fichier quitte votre navigateur. Pour rédiger un CV de zéro, Créer un CV le met en page dans l'un de ses 54 modèles. Les notes ci-dessous expliquent ce que contient réellement un document, et ce qui en survit à chaque conversion.

Livres numériques

2 outils

Livres Kindle et EPUB en PDF avec une table des matières fonctionnelle.

Créer des documents

1 outil

Créez un CV à partir d'un formulaire, avec le modèle de votre choix.

Ce que contient un document, et ce que chaque conversion en fait

Un .docx est un ZIP de fichiers XML, et l'essentiel de ce qui en fait un document n'est pas le texte. Il y a les styles — des définitions nommées comme Titre 1, partagées par de nombreux paragraphes — et la mise en forme directe, quand quelqu'un a sélectionné une ligne et appuyé sur Gras. Les deux se ressemblent à l'écran et se comportent de façon totalement différente à la conversion : un style survit en tant que style, un passage mis en forme directement ne survit que sous la forme de l'apparence qu'il produisait. À côté se trouvent les définitions de numérotation, les modifications suivies, les commentaires, les notes de bas de page, les en-têtes et pieds de page, les zones de texte, les polices incorporées et les propriétés du document, chacun stocké séparément du texte des paragraphes.

Les numéros de liste en sont l'exemple le plus parlant. Word ne stocke pas « 1. » sous forme de texte ; il stocke une référence à une définition de numérotation et calcule le numéro en dessinant la page. Les extracteurs de texte qui parcourent le XML des paragraphes perdent donc tous les numéros et vous rendent une liste sans numérotation. DOCX en TXT les reconstruit au contraire — « 1. », « 1.1 », « a) », « iii. » — y compris pour les listes qui recommencent ou se poursuivent au fil du document.

Modifications suivies et commentaires : un choix, pas un accident. Un document en cours de relecture contient à la fois le texte supprimé et le texte inséré, dans le même fichier, balisés. DOCX en TXT le lit comme si toutes les modifications avaient été acceptées : insertions conservées, suppressions écartées. Les commentaires ne sont pas inclus du tout, ce qui est généralement ce que l'on veut quand le texte brut est destiné à être rendu public. Les notes de bas de page et de fin apparaissent sous forme de repères [1], les notes étant regroupées à la fin ; les en-têtes et pieds de page peuvent être activés, et les zones de texte apparaissent une seule fois chacune, dans l'ordre de lecture, au lieu d'être répétées ou perdues.

Ce qu'une conversion en PDF fige, c'est la pagination. Dans un traitement de texte, l'endroit où se termine la page quatre est recalculé à chaque ouverture du fichier, avec les polices et le pilote d'imprimante de la personne qui l'ouvre — c'est pourquoi un document arrive chez le destinataire avec un tableau coupé sur deux pages, alors que ce n'est pas le cas chez vous. Un PDF ne fait pas ce recalcul : les sauts de page ont été décidés une fois pour toutes, à la conversion, et font désormais partie du fichier. Word en PDF, ODT en PDF et RTF en PDF obtiennent ces sauts d'une mise en page complète de traitement de texte, et non d'un navigateur qui en donne une approximation : c'est pourquoi zones de texte, formes, en-têtes et pieds de page tombent là où l'auteur les a placés.

Ce qu'elle fait perdre, c'est la possibilité de modifier et de réorganiser le texte. Les styles deviennent une mise en forme visuelle, le plan devient des signets, et le texte ne se réajuste plus à un écran de téléphone. Les polices incorporées dans le document sont utilisées telles quelles ; une police qui n'est ni incorporée ni disponible pour le convertisseur est remplacée par la police aux métriques compatibles la plus proche, si bien que les lignes se coupent toujours aux mêmes endroits, même si le dessin des lettres diffère.

Les livres numériques n'ont pas de pages à préserver. EPUB, MOBI et AZW3 sont des formats recomposables — l'application de lecture décide où se termine chaque page, selon la taille de police choisie —, donc « page 40 » n'est pas une propriété du livre, et la pagination de votre PDF est créée à la conversion, à partir du format de page et des marges que vous choisissez. Ce que contient le fichier, c'est la structure en chapitres et la table des matières, qui deviennent de vrais liens et signets PDF. L'AZW3 contient une feuille de style et souvent des polices incorporées : il ressort donc tel que l'éditeur l'a conçu. Les anciens fichiers MOBI n'ont aucune feuille de style, ce qui explique qu'un MOBI converti paraisse plus sobre que le même livre dans l'application Kindle — l'application ajoutait une typographie que le fichier n'a jamais contenue.

Le RTF, c'est du texte de bout en bout, et c'est pourquoi il traverse les décennies de logiciels. Son point faible, c'est l'encodage des caractères : le RTF est antérieur à Unicode et stocke le texte dans d'anciennes pages de codes — Europe centrale, cyrillique, grec, japonais —, d'où les caractères illisibles des RTF mal convertis. Ici, chacune est décodée correctement, tout comme le texte Unicode moderne.

Quand un navigateur n'est vraiment pas le bon outil

Certains de ces outils gardent votre fichier entièrement confidentiel, d'autres le confient à un serveur, et mieux vaut être précis sur lesquels. PDF en texte, TXT en PDF, DOCX en TXT, HTML en DOCX et Markdown en HTML n'envoient jamais rien : le fichier est lu, converti et écrit ici même, et rien ne sort. Word en PDF, ODT en PDF, RTF en PDF, HTML en PDF, Markdown en PDF et les trois convertisseurs de livres numériques font la conversion sur notre serveur, car reproduire la mise en page d'un traitement de texte, ou paginer correctement un livre, n'est pas quelque chose qu'une page web peut simuler. Ce qui est envoyé varie : les documents Word, ODT et RTF partent tels quels, tandis que les fichiers Markdown et les livres numériques sont d'abord décompressés et assemblés en page web, et c'est cette page assemblée qui est envoyée. Dans tous les cas, elle transite par une connexion chiffrée, est convertie, puis supprimée dès que votre téléchargement est prêt — rien n'est conservé, journalisé ni partagé. Chacun de ces outils se rabat aussi sur son propre convertisseur si le serveur est injoignable, vous prévient quand c'est le cas, et vous indique ce que la solution de repli n'a pas pu conserver.

Les formats que nous n'ouvrons pas. Les anciens fichiers binaires .doc de Word 97–2003 se convertissent sans problème avec Word en PDF, car le serveur les lit directement — mais DOCX en TXT, qui fonctionne dans le navigateur, ne le peut pas et demande un .docx. Pour les documents protégés par mot de passe, le mot de passe doit être retiré dans le programme qui l'a défini. Les livres Kindle protégés par DRM ne peuvent être ouverts par aucun convertisseur, où que ce soit — c'est tout l'objet de la protection —, pas plus que le format KFX, plus récent, d'Amazon, que seule l'application Kindle sait lire.

Le travail sur les longs documents. Documents maîtres, champs de renvoi, index, tables des références générées automatiquement, publipostage et gestionnaires de bibliographie sont des fonctions de traitement de texte, et un convertisseur n'est pas un traitement de texte. Installez LibreOffice : il est gratuit, il lit tous les formats de cette page, et pour ces tâches, c'est tout simplement le bon programme.

Les lots et l'automatisation. Ces outils fonctionnent quand une personne clique. Convertir un millier de fichiers selon un planning est un travail pour la ligne de commande, et les outils gratuits sont excellents : LibreOffice en mode headless convertit tout ce que Writer sait ouvrir, Pandoc passe du Markdown au HTML, au DOCX, au LaTeX et à une douzaine d'autres formats avec plus de contrôle que n'importe quel formulaire web, et Calibre traite les livres numériques en masse et convertit entre tous les formats de livres numériques non protégés qui existent.

Une mise en page fidèle dans l'autre sens. Retransformer un PDF très travaillé en document modifiable est un problème de déduction, pas une conversion, et rien ne le fait parfaitement — ni nous, ni les logiciels de bureau hors de prix. Si le document d'origine existe encore, modifiez-le.

Choisir entre des outils aux noms proches

Markdown en PDF ou Markdown en HTML. Le même analyseur, une destination différente. Markdown en PDF vous donne un document paginé avec la police, le format de page et les marges de votre choix, des titres transformés en signets PDF et une table des matières qui renvoie à la bonne page — pour imprimer, joindre ou archiver. Markdown en HTML vous donne soit une page autonome mise en forme, soit un simple extrait à coller dans un CMS — pour publier. Pour obtenir du Markdown dans Word, passez par Markdown en HTML, puis par HTML en DOCX.

Word en PDF, ODT en PDF ou RTF en PDF. La même conversion en coulisses ; seul change ce que vous leur donnez. Word en PDF pour les .docx. ODT en PDF pour tout ce qui vient de LibreOffice, d'OpenOffice ou d'un export Google Docs « Télécharger au format OpenDocument ». RTF en PDF pour WordPad, TextEdit et les lettres et rapports que produisent encore les logiciels de gestion. Choisir la page qui correspond à votre extension compte moins qu'on ne le croit — ce qui compte, c'est qu'aucune d'elles n'est TXT en PDF, qui n'a de toute façon aucune mise en forme à préserver.

TXT en PDF ou Markdown en PDF. TXT en PDF met votre texte en page comme du texte : une seule police, vos marges, aucune interprétation. Markdown en PDF lit les # et les * comme des instructions et produit titres, listes, tableaux, code coloré et plan en signets. Donnez un fichier Markdown à TXT en PDF, et vous obtiendrez un PDF plein d'astérisques.

EPUB, MOBI et AZW3 en PDF. Les trois acceptent plus de formats que leur nom ne le laisse penser, donc n'importe lequel ouvrira votre fichier ; les pages diffèrent parce que les livres diffèrent. L'EPUB et l'AZW3 (KF8) contiennent des feuilles de style et souvent des polices incorporées, et ressortent avec une vraie mise en page. Le MOBI est l'ancien conteneur, à la mise en forme minimale, et son PDF converti est volontairement sobre. Si un fichier Kindle contient les deux mises en page, c'est la plus récente qui est utilisée.

HTML en DOCX ou Markdown en HTML. HTML en DOCX commence par mettre en page le balisage : le CSS appliqué — polices, tailles, couleurs, espacements, bordures — est donc écrit dans le document sous forme de vraie mise en forme Word, avec les styles de titre de Word, de vraies listes et de vrais tableaux plutôt que des blocs figés en place. Markdown en HTML, lui, produit le balisage. Aucun des deux n'exécute jamais de JavaScript.

DOCX en TXT ou PDF en texte. Les deux vous rendent du texte brut, mais lisent des choses très différentes. Un .docx sait encore ce qu'est un paragraphe, une liste ou un tableau : DOCX en TXT peut donc reconstruire les numéros de liste et garder les lignes de tableau ensemble. Un PDF sait seulement où chaque caractère a été dessiné : PDF en texte déduit donc les lignes et les paragraphes de leur position — avec de bons résultats, mais jamais aussi fidèles à la structure. Si vous avez à la fois le document d'origine et son PDF, extrayez le texte du document.

DOCX en TXT ou « Enregistrer en .txt » dans Word. L'export en texte brut de Word perd la numérotation des listes, abîme les tableaux et a ses propres idées sur l'encodage. DOCX en TXT reconstruit la numérotation, écrit les tableaux soit en lignes séparées par des tabulations qui se collent dans un tableur, soit en colonnes alignées qui restent alignées même en chinois et en japonais, et enregistre en UTF-8 avec les fins de ligne de votre choix.

Sur quoi reposent ces outils

Les moteurs open source qui font le vrai travail, et les spécifications qu'ils mettent en œuvre.

  • LibreOfficeMPL-2.0 — effectue les conversions Office, sans interface, sur notre serveur.
  • docxMIT — écrit les fichiers Word dans le navigateur.
  • markdown-itMIT — analyse le Markdown, selon la spécification CommonMark.
  • foliate-jsMIT — ouvre les livres numériques EPUB, MOBI et KF8.
  • pdf-libMIT — compose les PDF de l'outil de création de CV, avec les polices intégrées et le texte sélectionnable.
  • Google FontsOFL-1.1 — fournit les trente polices des modèles de CV, d'Inter à EB Garamond.
  • LucideISC — dessine les icônes de contact des modèles de CV.
  • EPUB 3.3Specification — est le standard du W3C que lisent les outils de livres numériques.

Questions fréquentes

Mes documents sont-ils conservés quelque part ?

Cela dépend de l'outil, et chacun l'indique sur sa propre page. PDF en texte, TXT en PDF, DOCX en TXT, HTML en DOCX et Markdown en HTML n'envoient jamais rien : ils fonctionnent dans cet onglet. Les conversions qui produisent un PDF mis en page — Word, ODT, RTF, HTML, Markdown et les trois formats de livres numériques — envoient le fichier à notre serveur via une connexion chiffrée, car elles ont besoin d'une vraie mise en page ; il est converti puis supprimé immédiatement, et rien n'est conservé, journalisé ni partagé.

Pourquoi le PDF ne ressemble-t-il pas exactement à mon document ?

Presque toujours à cause des polices. Si une police n'est pas incorporée dans le fichier et n'est pas disponible pour le convertisseur, c'est la police de remplacement aux métriques compatibles la plus proche qui est utilisée — mêmes largeurs, donc aucun décalage du texte, mais un dessin de lettres différent. Incorporez vos polices avant la conversion si le rendu doit être exact, ou utilisez des polices largement disponibles.

Puis-je convertir un livre Kindle que j'ai acheté ?

Seulement s'il n'est pas protégé par DRM. Les livres de la boutique Kindle sont chiffrés, et aucun convertisseur ne peut les ouvrir ; l'outil détecte un fichier protégé et vous le signale au lieu de produire des pages de caractères incompréhensibles. Les livres sans DRM — de l'auteur, du Projet Gutenberg, d'un éditeur qui les vend ainsi — se convertissent normalement.

Y a-t-il une limite de taille ou une limite quotidienne ?

Pas de compte, pas de plafond quotidien. Les outils qui fonctionnent dans le navigateur sont limités par la mémoire de votre appareil. Les documents envoyés à notre serveur sont limités à 40 MB, et la page vous indique clairement si votre fichier dépasse cette limite, au lieu d'échouer en cours de route.

Y aura-t-il un filigrane ?

Non. Aucun outil ici n'appose de mention d'essai sur votre document, ne limite le nombre de pages ni ne dégrade le résultat. Ce sont les publicités sur la page qui permettent la gratuité.

Mon fichier est un .doc, pas un .docx. Est-ce que ça fonctionne ?

Avec Word en PDF, oui : le serveur lit directement l'ancien format binaire .doc, sans réenregistrement. Les outils qui fonctionnent dans le navigateur ne le peuvent pas : le .doc est un format entièrement différent, pas une variante du .docx, et le décoder dans un onglet ne vaut pas le téléchargement nécessaire. Ouvrez-le une fois dans Word ou LibreOffice, enregistrez-le en .docx, et tous les outils ici l'accepteront.