PDF in Excel umwandeln
Holen Sie die Tabellen aus einem PDF in eine echte .xlsx, die Sie sortieren, filtern und summieren können – rekonstruiert aus der Seite selbst.
- Nie gespeichert
- Keine Warteschlange, kein Warten
- Ohne Anmeldung, ohne Wasserzeichen
So funktioniert’s
PDF hinzufügen
Legen Sie das Dokument mit der benötigten Tabelle ab.
Umwandeln
Zeilen werden anhand gemeinsamer Grundlinien erkannt, Spalten anhand der Stellen, an denen Text auf der Seite beginnt.
Herunterladen
Ein Tabellenblatt pro Seite, das sich in Excel, Google Sheets, Numbers und LibreOffice öffnen lässt.
Wie aus etwas ohne Raster ein Raster wird
Ein PDF enthält keine Tabelle. Es enthält Zeichen an Koordinaten, und die Linien, die wie eine Tabelle aussehen, sind gezeichnete Grafik ohne Verbindung zum Text darin. Das Raster wird also erschlossen, nach zwei Regeln, die man genau kennen sollte. Zeilen ergeben sich aus gemeinsamen Grundlinien, wobei die vertikale Position in Vier-Punkt-Stufen gerundet wird, damit ein hochgestelltes Zeichen oder ein leicht angehobenes Währungssymbol keine eigene Zeile beginnt. Spalten entstehen, indem jede unterschiedliche linke Kante auf der Seite gesammelt wird und je zwei, die weniger als acht Punkt auseinanderliegen, zusammengelegt werden – über die ganze Seite statt Zeile für Zeile, sodass eine Spalte, die in einer Zeile zufällig leer ist, in den anderen ihren Platz behält.
Deshalb sind rechtsbündige Zahlen der schwierige Fall, und das sollte man klar sagen, weil es hier die häufigste Enttäuschung ist. Eine rechtsbündige Zahlenspalte hat in jeder Zeile eine andere linke Kante – 9.99 beginnt weit rechts von 1,234,567.89 –, und sobald diese Kanten mehr als acht Punkt auseinanderliegen, werden sie als unterschiedliche Spalten gelesen. Eine Finanztabelle kann daher über mehrere Spalten verteilt ankommen, die eigentlich eine sein sollten. Links ausgerichtete und zentrierte Spalten haben dieses Problem nicht. Zwei Textstücke, die tatsächlich in derselben Zelle landen, werden mit einem Leerzeichen verbunden, statt dass eines das andere überschreibt.
Zellen bekommen beim Schreiben einen Typ: Alles, was sich sauber als Zahl auswerten lässt, wird als Zahl geschrieben und lässt sich summieren, alles andere wird als Text geschrieben. Die üblichen Buchhaltungs-Verzierungen lassen sich nicht auswerten – ein Tausendertrennzeichen, ein nachgestelltes Prozentzeichen, ein Währungssymbol oder ein negativer Wert in Klammern wie (1,234) –, solche Zellen kommen also als Text an, der nach Zahl aussieht und sich nicht addieren lässt. Die Excel-Funktion „Text in Spalten“ behebt eine ganze Spalte davon in einem Durchgang.
Jede Seite wird zu einem eigenen Tabellenblatt namens „Page 1“, „Page 2“ und so weiter, statt zu einer durchgehenden Tabelle zusammengesetzt zu werden – eine dreiseitige Tabelle kommt als drei Tabellenblätter mit wiederholter Kopfzeile an. Übernommen werden nur Werte. Formeln waren nie im PDF, um sie wiederherzustellen, und Füllfarben, Rahmen, Schriften, verbundene Zellen und Diagramme werden bewusst nicht rekonstruiert, weil Raten eine Tabelle ergibt, die verlässlich aussieht und im Detail falsch ist.
Wenn Sie etwas anderes brauchen
Tabellenextraktion ist ein echtes Forschungsproblem, und es gibt Tools, die nichts anderes tun. Tabula ist die richtige Wahl, wenn die Tabellen Linien haben: Es liest die gezeichneten Linien als Raster, statt eines aus Textpositionen zu erschließen, und löst damit den Fall der rechtsbündigen Zahlen vollständig. Es ist kostenlos, hat eine Oberfläche zum Klicken und exportiert CSV. Camelot macht dasselbe aus Python heraus, mit einem Lattice-Modus für Tabellen mit Linien und einem Stream-Modus für solche ohne, und sagt Ihnen, wie sicher es sich ist.
Wenn das Layout einfach ist und Sie es nur lesbar haben möchten, behält pdftotext -layout in.pdf out.txt von Poppler die Spaltenabstände als Nur-Text bei, der sich direkt als Daten mit fester Breite in einer Tabellenkalkulation öffnen lässt und das Erschließen ganz überspringt. Und wenn das PDF ein Scan ist, gilt nichts davon – es gibt keinen Text zum Positionieren, und es braucht zuerst OCR.
Häufig gestellte Fragen
Wie kann eine PDF-Tabelle überhaupt zu einer Tabellenkalkulation werden?
Ein PDF kennt keine Tabellen – nur Zeichen an Koordinaten. Das Raster wird neu aufgebaut: Text auf einer gemeinsamen Grundlinie wird zu einer Zeile, und die linken Kanten des Textes auf der ganzen Seite werden zu Spalten gruppiert, sodass eine Zelle, die in einer Zeile leer ist, in den anderen trotzdem ihren Platz behält.
Wie genau ist das?
Sehr gut bei sauberen Tabellen mit Linien und gleichmäßigen Spalten. Schwierig wird es bei verbundenen Zellen, umbrochenem Text innerhalb einer Zelle und Spalten, die über die Seite verrutschen – all das ist ohne Wissen über die Bedeutung der Tabelle wirklich mehrdeutig. Prüfen Sie das Ergebnis, bevor Sie sich darauf verlassen.
Bleiben Zahlen Zahlen?
Ja. Alles, was sich als Zahl lesen lässt, wird als numerische Zelle geschrieben, sodass Summen und Formeln sofort funktionieren, statt alles als Text zu behandeln.
Wird mein PDF irgendwo gespeichert?
Nein. Jede Seite wird gelesen, ohne gespeichert zu werden.
Was ist mit einem gescannten PDF?
Aus einem Scan lässt sich kein Text extrahieren. Nutzen Sie zuerst „PDF-OCR“ und wandeln Sie dann um.
Gut zu wissen: Verbundene Zellen, mehrzeilige Zellen und verrutschte Spalten sind die schwierigen Fälle und müssen danach eventuell aufgeräumt werden. Formatierung, Farben, Formeln und Diagramme werden nicht nachgebildet – Werte schon. Jede PDF-Seite wird zu einem eigenen Tabellenblatt, statt zu einer langen Tabelle zusammengesetzt zu werden.
Dieses Tool auf Ihrer Website einbinden
Kostenlos für jeden Blog, jede Kursseite und jeden Hilfeartikel. Fügen Sie ein einziges Snippet ein, und Ihre Besucher können das Tool direkt auf Ihrer Seite nutzen.