Zum Inhalt springen

PDF in HTML umwandeln

Machen Sie aus einem PDF eine einzige HTML-Datei, die wie das Original aussieht und nichts weiter braucht – kein Stylesheet, keine Schriften, keinen Bilderordner.

  • Nie gespeichert
  • Keine Warteschlange, kein Warten
  • Ohne Anmeldung, ohne Wasserzeichen

So funktioniert’s

1

PDF hinzufügen

Legen Sie das Dokument ab, das Sie als Webseite haben möchten.

2

Umwandeln

Jede Seite wird als positionierter Block mit ihren Grafiken und ihrem Text neu aufgebaut.

3

Herunterladen

Eine einzige .html-Datei, die Sie so, wie sie ist, öffnen, hosten oder per E-Mail versenden können.

Eine Datei, keine Abhängigkeiten, festes Layout

Heraus kommt eine einzige .html-Datei, ohne irgendetwas daneben. Jedes Bild ist als Data-URI eingebettet, das Stylesheet steht im Head, und keine Schrift wird von irgendwoher geladen – die Seite öffnet sich also auch auf einem Rechner ohne Internetverbindung genauso, und nur diese Art von HTML-Export ist überhaupt etwas wert. Der Preis ist reine Arithmetik: Binäre Bilddaten als Text zu kodieren macht sie etwa ein Drittel größer, ein 10 MB großes PDF aus Scans landet also bei rund 14 MB HTML, die ein Browser komplett verarbeiten muss, bevor er etwas anzeigt.

Das Layout ist fest, nicht responsiv, und das ist eine Entscheidung, kein Versäumnis. Jede Seite ist ein Kasten mit den exakten Abmessungen des PDFs in Punkt, und jede Textzeile ist ein absolut positioniertes Span an ihren ursprünglichen Koordinaten, mit übernommener Größe und Farbe. Nichts fließt je um – auf dem Smartphone bekommen Sie die ganze Seite verkleinert, keine Spalte mit lesbarem Text. Ein Druck-Stylesheet ist enthalten, sodass der Ausdruck des HTML sauber an den ursprünglichen Seitengrenzen umbricht.

Weil keine Schriften mit der Datei reisen, wird der Text in der Helvetica oder Arial gesetzt, die der Rechner des Lesers hat. Größe und Position stimmen, die Buchstabenformen nicht – eine Zeile kann also etwas breiter laufen als die Grafik dahinter. Einen netten Trick sollte man kennen: Wenn die Wörter einer Seite Teil der gezeichneten Grafik sind statt echter Text, wird die Textebene trotzdem geschrieben, aber transparent – so bleibt die Seite markierbar und durchsuchbar, ohne dass die Wörter doppelt erscheinen.

Links im PDF kommen als reiner Text statt als Anker an, Überschriften als positionierte Spans statt als Überschriftenelemente, und eine Lesereihenfolge gibt es praktisch nicht. Das Ergebnis ist ein genaues Abbild eines Dokuments, das zufällig aus HTML besteht – es ist kein strukturiertes, semantisches Markup und sollte nicht dort eingesetzt werden, wo ein Screenreader oder eine Suchmaschine etwas damit anfangen muss.

Wenn Sie etwas anderes brauchen

pdf2htmlEX ist das Tool, das diese Aufgabe richtig erledigt. Es extrahiert die eigenen Schriften des PDFs und bettet sie als Webfonts ein, sodass der Text nicht nur richtig positioniert, sondern auch in der richtigen Schrift mit der richtigen Breite gesetzt ist, und es baut Vektorgrafiken als Vektoren nach, statt die Seite zu einem Bild zu reduzieren. Das Ergebnis ist deutlich originalgetreuer – und deutlich komplizierter. Popplers pdftohtml -s -c in.pdf out.html ist der schnelle Mittelweg.

Wenn Sie eigentlich eine Webseite wollen und kein Bild einer Seite – etwas, das auf dem Smartphone umfließt, das Google lesen und durch das ein Screenreader navigieren kann –, liefert Ihnen das kein PDF-in-HTML-Konverter, weil die nötige Struktur beim Erstellen des PDFs verloren gegangen ist. Wandeln Sie es in Word um, im Fließtext-Modus, und exportieren Sie von dort – oder greifen Sie auf das zurück, woraus das PDF ursprünglich gedruckt wurde.

Häufig gestellte Fragen

Ist es wirklich nur eine Datei?

Ja. Jedes Bild ist als Data-URI eingebettet und die Stile stehen in der Datei selbst – es gibt also keinen Ordner mit Ressourcen, den man zusammenhalten müsste, und die Datei öffnet sich ohne Internetverbindung genauso.

Ist der Text markierbar?

Ja. Der Text wird als echter HTML-Text über die Grafik gelegt, sodass er markiert, durchsucht und von einem Screenreader gelesen werden kann.

Passt sich das Layout auf dem Smartphone an?

Nein, und das ist der ehrliche Kompromiss: Jede Seite behält ihr exaktes Layout, sodass das Ergebnis wie das PDF aussieht und nicht wie eine responsive Website. Wenn Sie umfließenden Text möchten, verwenden Sie PDF in Word oder PDF in Text.

Wird mein PDF irgendwo gespeichert?

Nein. Zu keinem Zeitpunkt wird etwas gespeichert.

Kann ich es drucken?

Ja – ein Druck-Stylesheet ist enthalten, sodass jede Seite auf einem eigenen Blatt gedruckt wird, ohne die Schatten der Bildschirmansicht.

Gut zu wissen: Das Layout ist fest, nicht responsiv: Seiten behalten ihre exakten Abmessungen und fließen auf kleinen Bildschirmen nicht um. Die Seitengrafik wird als Rasterbild eingebettet, daher ergeben sehr große Dokumente große HTML-Dateien. Links im PDF werden zu reinem Text.

Dieses Tool auf Ihrer Website einbinden

Kostenlos für jeden Blog, jede Kursseite und jeden Hilfeartikel. Fügen Sie ein einziges Snippet ein, und Ihre Besucher können das Tool direkt auf Ihrer Seite nutzen.