PDF in Text umwandeln
Holen Sie die Wörter aus einem PDF heraus, mit intakten Zeilen und Absätzen – direkt in die Zwischenablage kopieren oder als .txt-Datei herunterladen. Es wird nichts gespeichert.
- Nie gespeichert
- Keine Warteschlange, kein Warten
- Ohne Anmeldung, ohne Wasserzeichen
So funktioniert’s
PDF hinzufügen
Legen Sie das PDF auf der Seite ab. Die Extraktion beginnt sofort, Seite für Seite.
Lesen und anpassen
Der Text erscheint in einem bearbeitbaren Feld. Schalten Sie die Markierungen für Seitenumbrüche ein oder aus und ändern Sie vor dem Speichern, was Sie möchten.
Kopieren oder herunterladen
Alles in die Zwischenablage kopieren oder als .txt-Datei herunterladen.
Woher die Wörter kommen – und in welcher Reihenfolge
Die Zeichen in einem PDF sind nicht als Text gespeichert. Sie sind als Glyphennummern abgelegt, die auf eine eingebettete Schrift verweisen, und ob daraus wieder Buchstaben werden, hängt von einer Tabelle in der Datei ab, die angibt, welches Zeichen jede Glyphe darstellt. Die meisten Programme schreiben sie mit. Fehlt sie – und abgespeckte Schrift-Teilmengen aus mancher Design-Software sind der übliche Grund –, sieht die Seite auf dem Bildschirm perfekt aus und liefert beim Extrahieren Zeichensalat, weil die Information, die man zum Lesen braucht, nie aufgeschrieben wurde. Kein Extraktor kann das beheben; es fehlen schlicht Daten, es ist kein schwieriges Problem.
Prüfen Sie die Lesereihenfolge, bevor Sie dem Ergebnis vertrauen. Der Text kommt in der Reihenfolge heraus, in der die Seite ihn zeichnet – also so, wie das Programm, das das PDF erstellt hat, ihn zufällig ausgegeben hat –, und das ist häufig nicht die Reihenfolge, in der ein Mensch liest. Eine zweispaltige Seite wird oft sauber als linke und rechte Spalte extrahiert, oder aber mit ineinander verschachtelten Zeilen – je nachdem, wie sie erzeugt wurde. Kopf- und Fußzeilen, Seitenzahlen und Randspalten landen dort, wo sie gezeichnet wurden, meist mitten im Fließtext.
Ein paar kleine Artefakte sollte man kennen, statt darüber zu rätseln. Ligaturen kommen als das einzelne Zeichen heraus, das die Schrift tatsächlich verwendet hat – „finden“ kann also mit einer Glyphe statt mit f und i ankommen, und eine einfache Suche nach „finden“ findet es dann nicht. Wörter, die am Zeilenende getrennt wurden, bleiben getrennt, weil der Umbruch in der Datei tatsächlich existiert. Und gerade Anführungszeichen sind häufig typografische – wichtig, wenn der Text in Code oder eine CSV wandert.
Eine gescannte Seite liefert gar nichts, und das Tool sagt das auch, statt eine leere Datei zurückzugeben – in einem Foto eines Dokuments gibt es keine Zeichen, nur Pixel. Dasselbe gilt für Text, der in Konturen umgewandelt wurde, was Designer bewusst tun, damit eine Datei überall identisch gedruckt wird; dann ist er tatsächlich Grafik. Beides braucht OCR statt Extraktion.
Wenn Sie etwas anderes brauchen
Wenn es auf die Spalten ankommt, ist Popplers pdftotext -layout in.pdf out.txt besser als alles, was ein Browser leisten kann: Es bildet die visuellen Abstände mit echten Leerzeichen nach, sodass Spalten Spalten bleiben und eine Tabelle eine lesbare Tabelle. pdftotext -raw geht den umgekehrten Weg und liefert die unveränderte Zeichenreihenfolge – gelegentlich genau das, was ein Skript braucht.
Für Text aus Hunderten von Dateien sind mutool draw -F txt und Pythons pdfplumber die richtige Grundlage – vor allem pdfplumber liefert jedes Zeichen mit Koordinaten, Schrift und Größe, sodass Sie Kopf- und Fußzeilen nach Position herausfiltern können statt nach Gefühl. Das ist die Aufgabe, die diese Seite nicht erledigen kann, und bei großen Mengen ist es die entscheidende.
Häufig gestellte Fragen
Bleiben Absätze und Zeilenumbrüche erhalten?
Ja. Ein PDF speichert überhaupt keine Absätze – nur Zeichen an Koordinaten –, deshalb wird der Text neu aufgebaut: Wörter auf gemeinsamen Grundlinien werden zu Zeilen gruppiert, und wo der vertikale Abstand größer wird, beginnt ein neuer Absatz. Das Ergebnis liest sich wie das Original statt wie ein einziger durchgehender Block.
Wird mein PDF irgendwo gespeichert?
Nein. Der Text wird von Ihrem eigenen Browser gelesen und nirgendwohin gesendet. Sie können nach dem Laden der Seite sogar die Internetverbindung trennen – es funktioniert trotzdem.
Es heißt, mein PDF enthält keinen Text – warum?
Weil es ein Scan oder ein Foto ist: Die Seite ist ein Bild, und Bilder enthalten keinen Text, den man extrahieren könnte. Verwenden Sie PDF-OCR – das liest die Wörter aus dem Bild selbst.
Kann ich den Text vor dem Herunterladen bearbeiten?
Ja – das Feld ist vollständig bearbeitbar, und genau das, was Sie sehen, wird gespeichert.
Was ist mit Tabellen und Spalten?
Spalten werden in der Reihenfolge gelesen, in der das PDF sie zeichnet. Das stimmt meistens, kann bei komplexen mehrspaltigen Layouts aber durcheinandergeraten. Tabellen kommen als Textzeilen heraus, nicht als Raster – für Tabellen verwenden Sie PDF in Excel.
Gut zu wissen: Nur-Text hat keine Formatierung: Fettdruck, Schriftgrößen, Farben, Bilder und Tabellenstruktur fallen per Definition weg. Text, der als Vektorkontur statt als echte Zeichen gezeichnet ist (häufig bei Logos und manchen Designer-PDFs), kann ohne OCR von keinem Tool extrahiert werden.
Dieses Tool auf Ihrer Website einbinden
Kostenlos für jeden Blog, jede Kursseite und jeden Hilfeartikel. Fügen Sie ein einziges Snippet ein, und Ihre Besucher können das Tool direkt auf Ihrer Seite nutzen.
Weitere PDF-Tools
PDF in Word
In bearbeitbare .docx umwandeln, mit OCR für Scans
PDF-OCR
Einen Scan durchsuchbar machen
TXT in PDF
Text oder Notizen als ordentliches PDF
PDF in HTML
Eine einzige, in sich geschlossene Webseite
PDF in PDF/A
Archivformat für die Langzeitarchivierung
PDF in Excel
Tabellen in eine echte Tabellenkalkulation