Zum Inhalt springen

Warum Sie ein gescanntes PDF nicht durchsuchen können

Weil keine Wörter darin sind. Wer versteht, was tatsächlich in der Datei steckt, kann jedes Symptom erklären – und findet die eine Einstellung, die entscheidet, wie gut es sich beheben lässt.

Zuletzt geprüft am

In der Datei sind keine Wörter

Ein PDF kann zwei völlig verschiedene Dinge enthalten, die am Bildschirm identisch aussehen. Ein aus Word exportiertes Dokument enthält Text – echte Zeichen, jedes mit Position und Schrift –, deshalb können Sie einen Satz markieren, nach einem Namen suchen und einen Absatz kopieren. Ein gescanntes Dokument enthält ein Foto einer Seite. Darin gibt es nichts als Pixel, genau so, wie das Foto eines Verkehrsschilds nur aus Pixeln besteht.

Jedes Symptom folgt aus dieser einen Tatsache. Die Suche findet nichts, weil es nichts gibt, was passen könnte. Markieren funktioniert nicht, weil es keinen Text zum Markieren gibt – der Cursor zieht stattdessen ein Rechteck über ein Bild. Kopieren liefert nichts. Die Datei ist für ihre Länge groß, weil Bilder schwer sind und Wörter nicht. Und eine Umwandlung in Word ergibt entweder ein leeres Dokument oder ein Bild, das in eines eingefügt wurde.

Der Schnelltest: Versuchen Sie, mit der Maus ein einzelnes Wort zu markieren. Erscheint ein Textcursor und ein hervorgehobenes Wort, ist echter Text vorhanden. Erscheint ein Rahmen, ist es ein Bild.

Was OCR tatsächlich hinzufügt

Die optische Zeichenerkennung (OCR) liest die Formen im Bild und ermittelt, welche Buchstaben es sind. Der nützliche Teil kommt danach: Die erkannten Wörter werden als unsichtbarer Text, passgenau über den Wörtern im Bild, zurück ins PDF geschrieben. Die Seite sieht genauso aus wie vorher, weil sich optisch nichts geändert hat – aber jetzt lässt sie sich durchsuchen, markieren, kopieren und indexieren.

Das ist ein bewusst zurückhaltendes Konzept und für Dokumente genau das richtige. Nichts wird neu gesetzt, ein Vertrag sieht also weiterhin aus wie der Vertrag, der unterschrieben wurde, und der ursprüngliche Scan bleibt die visuelle Aufzeichnung. PDF-OCR macht ein gescanntes PDF in einem Durchgang durchsuchbar und richtet die Seiten dabei meist auch gerade aus und dreht sie, weil das Lesen das ohnehin erfordert hat.

Wenn Sie ein bearbeitbares Dokument statt eines durchsuchbaren wollen, ist das eine andere und viel schwierigere Aufgabe: Der Text muss extrahiert, das Layout erschlossen und das Ergebnis als Absätze und Tabellen neu aufgebaut werden. PDF in Word erledigt das, und das Ergebnis muss immer geprüft werden – anders als eine Textebene.

Die Einstellung, die alles entscheidet: 300 DPI

Die Erkennungsgenauigkeit hängt viel stärker vom Scan ab als von der Software, und die wichtigste Zahl ist die Auflösung. 300 DPI sind der Standard, und das ist nicht willkürlich – dabei entfallen auf normalen Fließtext rund 30 Pixel Höhe, deutlich mehr als das Minimum, um ähnliche Buchstabenformen zu unterscheiden.

Bei 150 DPI sinkt die Genauigkeit spürbar, und die Fehler sind von der heimtückischen Sorte: eine 1 wird als l gelesen, eine 5 als S, rn als m. Darunter verschlechtert es sich schnell. Über 300 hinauszugehen hilft selten und macht die Dateien viel größer – 600 DPI lohnen sich nur bei sehr kleiner Schrift oder schlechten Vorlagen.

Drei weitere Aufnahmeeinstellungen sind fast genauso wichtig. Graustufen statt Schwarzweiß, weil ein harter Schwellenwert die dünnen Teile der Buchstaben zerstört. Flach und gerade zum Sensor, weil sich auf einer schräg fotografierten Seite die Buchstabenformen über die Seite hinweg verändern. Und gleichmäßig ausgeleuchtet – der klassische Fehler ist Ihr eigener Schatten auf einer Seite, die Sie von oben fotografieren.

Was keine OCR lesen kann

Ehrlichkeit an dieser Stelle spart viel Zeit. Verbundene Schreibschrift wird von allgemeiner OCR nicht erkannt, und der Grund ist struktureller Natur, keine Frage des Aufwands: Druckschrift wird gelesen, indem die Grenzen zwischen Buchstaben gefunden werden, und in Schreibschrift gibt es keine. Handgeschriebene Druckbuchstaben, Großbuchstaben und Formularkästchen funktionieren oft gut, weil es einzelne Formen mit Lücken dazwischen sind.

Text, der Teil eines Fotos ist – Wörter auf einem Schild, auf einem Produkt, vor einem unruhigen Hintergrund –, ist viel schwieriger als Text auf Papier, und stark stilisierte oder dekorative Schrift ist noch schwieriger. Kopien von Kopien verlieren die dünnen Striche, die Buchstaben unterscheiden. Und ein Dokument mit Stempeln, Anmerkungen oder Markierungen liest sich überall dort schlechter, wo diese den Text überlagern.

Ein gutes Tool zeigt Ihnen, wie sicher es sich war, und diese Zahl ist dazu da, genutzt zu werden. Eine geringe Sicherheit mitten in einem Satz, den Sie aus dem Zusammenhang lesen können, zählt viel weniger als eine geringe Sicherheit bei einer Ziffer in einer Kontonummer. Gefährlich sind die Fehler, bei denen sich das Tool sicher war, weil nichts auf sie hinweist.

Warum das mehr ist als eine Frage der Bequemlichkeit

Ein gescanntes Archiv ohne Textebene ist praktisch verloren. Nichts kann es durchsuchen, nichts kann es indexieren, kein Compliance-System findet einen Namen darin, und kein Screenreader kann es vorlesen – was die Veröffentlichung in vielen Rechtsordnungen zu einem rechtlichen Problem statt zu einer bloßen Unannehmlichkeit macht.

Deshalb lohnt es sich auch, gleich beim ersten Mal auf die richtigen Scaneinstellungen zu bestehen. Einen Karton Dokumente neu zu scannen, kostet weit mehr, als ihn einmal ordentlich zu scannen, und keine Nachbearbeitung stellt Details wieder her, die nie erfasst wurden.

Häufig gestellte Fragen

Wie genau ist OCR wirklich?

Bei einem sauberen Scan mit 300 DPI von normalem gedrucktem Text sehr genau – so genau, dass Fehler die Ausnahme statt die Regel sind. Bei einem schräg und bei schlechtem Licht aufgenommenen Handyfoto drastisch schlechter. Die Scanqualität zählt weit mehr als die Wahl der Software.

Verändert OCR das Aussehen meines Dokuments?

Nein. Der erkannte Text wird unsichtbar über das vorhandene Bild gelegt, die Seite sieht also genauso aus wie vorher. Die Seiten werden dabei meist gerade ausgerichtet und aufrecht gestellt – schiefe Scans sehen dadurch besser aus, nicht anders.

Kann ich den Text nach der OCR bearbeiten?

Nicht im PDF selbst – die sichtbare Seite ist weiterhin ein Bild, und die Textebene liegt unsichtbar darüber. Für etwas Bearbeitbares wandeln Sie das erkannte Dokument in Word um und rechnen damit, das Ergebnis prüfen zu müssen.

Funktioniert OCR bei Handschrift?

Einzeln stehende, in Druckschrift geschriebene Buchstaben und ausgefüllte Formulare funktionieren oft. Verbundene Schreibschrift nicht, in keinem allgemeinen OCR-Tool – die Buchstaben gehen ineinander über, ohne Grenzen, die sich finden ließen. Speziell auf Handschrift trainierte Tools schneiden besser ab, um den Preis, dass Ihre Seiten an einen Drittanbieter gehen.

Warum ist mein durchsuchbares PDF so viel größer?

Es sollte sich kaum verändern – eine Textebene hat wenige Kilobyte pro Seite. Ist es stark gewachsen, wurden die Seiten vermutlich neu gerendert statt beibehalten. Das sollten Sie prüfen, denn der Sinn einer Textebene ist, dass das Originalbild unverändert erhalten bleibt.