Convertir un PDF en HTML
Transformez un PDF en un seul fichier HTML fidèle à l'original et qui n'a besoin de rien d'autre — ni feuille de style, ni polices, ni dossier d'images.
- Jamais conservé
- Pas de file d'attente, pas d'attente
- Sans inscription, sans filigrane
Comment ça marche
Ajoutez votre PDF
Déposez le document à transformer en page web.
Convertissez
Chaque page est reconstruite en un bloc positionné, avec ses illustrations et son texte.
Téléchargez
Un seul fichier .html à ouvrir, héberger ou envoyer par e-mail tel quel.
Un seul fichier, aucune dépendance, une mise en page fixe
Le résultat est un unique fichier .html, sans rien à côté. Chaque image est intégrée sous forme de data URI, la feuille de style est dans l'en-tête et aucune police n'est chargée depuis l'extérieur — la page s'ouvre donc à l'identique sur une machine sans connexion Internet, ce qui est la seule forme d'export HTML qui vaille. Le prix est arithmétique : encoder des données d'image binaires en texte les alourdit d'environ un tiers, si bien qu'un PDF de scans de 10 MB donne près de 14 MB de HTML, que le navigateur doit entièrement analyser avant d'afficher quoi que ce soit.
La mise en page est fixe, pas responsive, et c'est un choix, pas un oubli. Chaque page est une boîte aux dimensions exactes du PDF, en points, et chaque ligne de texte est un span positionné en absolu à ses coordonnées d'origine, avec sa taille et sa couleur. Rien ne se réagence, jamais — sur un téléphone, vous obtenez la page entière réduite, pas une colonne de texte lisible. Une feuille de style d'impression est incluse : imprimer le HTML coupe proprement aux limites des pages d'origine.
Comme aucune police ne voyage avec le fichier, le texte est affiché dans la Helvetica ou l'Arial disponible sur la machine du lecteur. La taille et la position sont justes, les formes des lettres non, si bien qu'une ligne peut déborder légèrement de l'illustration qui se trouve derrière. Une astuce bien pensée mérite d'être connue : quand les mots d'une page font partie de l'illustration dessinée plutôt que du vrai texte, la couche de texte est quand même écrite, mais en transparence — la page reste ainsi sélectionnable et consultable par recherche sans que les mots apparaissent deux fois.
Les liens du PDF arrivent en texte simple plutôt qu'en ancres, les titres arrivent en spans positionnés plutôt qu'en éléments de titre, et il n'y a pas vraiment d'ordre de lecture. Le résultat est une image fidèle d'un document qui se trouve être fait de HTML — ce n'est pas un balisage structuré et sémantique, et il ne faut pas l'utiliser là où un lecteur d'écran ou un moteur de recherche doit s'y retrouver.
Si vous cherchez autre chose
pdf2htmlEX est l'outil qui fait cela correctement. Il extrait les polices du PDF et les intègre en polices web : le texte n'est pas seulement bien positionné, il est composé dans le bon caractère, à la bonne largeur, et les illustrations vectorielles sont reconstruites en vectoriel au lieu d'aplatir la page en image. Le résultat est nettement plus fidèle et nettement plus complexe. pdftohtml -s -c in.pdf out.html de Poppler est le compromis rapide.
Si ce que vous voulez vraiment, c'est une page web et non l'image d'une page — quelque chose qui se réagence sur un téléphone, que Google peut lire, dans lequel un lecteur d'écran peut naviguer —, aucun convertisseur PDF en HTML ne vous le donnera, car la structure nécessaire a été jetée au moment où le PDF a été créé. Convertissez-le en Word en mode texte continu et exportez depuis Word, ou repartez du document à partir duquel le PDF a été imprimé.
Questions fréquentes
Est-ce vraiment un seul fichier ?
Oui. Chaque image est intégrée sous forme de data URI et les styles sont dans le fichier lui-même : aucun dossier de ressources à garder avec, et il s'ouvre à l'identique sans connexion Internet.
Le texte est-il sélectionnable ?
Oui. Le texte est écrit en vrai texte HTML positionné par-dessus les illustrations : on peut le sélectionner, y faire des recherches, et un lecteur d'écran peut le lire.
La mise en page s'adapte-t-elle sur un téléphone ?
Non, et c'est le compromis assumé : chaque page garde sa mise en page exacte, si bien que le résultat ressemble au PDF et non à un site web responsive. Si vous voulez un texte qui se réagence, utilisez PDF en Word ou PDF en texte.
Mon PDF est-il conservé quelque part ?
Non. Rien n'est conservé, à aucun moment.
Puis-je l'imprimer ?
Oui — une feuille de style d'impression est incluse, pour que chaque page s'imprime sur sa propre feuille, sans les ombres affichées à l'écran.
Bon à savoir : La mise en page est fixe, pas responsive : les pages gardent leurs dimensions exactes et ne se réagencent pas sur les petits écrans. Les illustrations des pages sont intégrées en image matricielle, donc les très gros documents donnent de gros fichiers HTML. Les liens du PDF deviennent du texte simple.
Intégrez cet outil à votre site
Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.
Voir aussi : Outils PDF
HTML en PDF
Du HTML en PDF, exactement comme l'imprime un navigateur
PDF en texte
Du texte brut à copier et modifier
PDF en Word
En .docx modifiable, avec OCR pour les scans
PDF en PDF/A
Le format d'archivage pour la conservation à long terme
PDF en Excel
Des tableaux dans un vrai classeur
PDF en PowerPoint
Des diapositives modifiables à partir de n'importe quel PDF