Gescanntes PDF durchsuchbar machen
Lesen Sie die Wörter aus einem Scan aus und legen Sie sie unsichtbar über die Seiten. Das Dokument sieht gleich aus – es wird nur durchsuchbar, markierbar und kopierbar. Schief oder seitlich gescannte Seiten werden gerade ausgerichtet.
- Nie gespeichert
- Keine Warteschlange, kein Warten
- Ohne Anmeldung, ohne Wasserzeichen
So funktioniert’s
Gescanntes PDF hinzufügen
Legen Sie die Datei ab. Das Tool prüft, ob sie bereits eine Textebene hat, und sagt Ihnen, wenn OCR ein Rückschritt wäre.
Sprache prüfen
Das Tool liest die erste Seite und zeigt an, welche Sprache es erkannt hat. Über 120 stehen zur Auswahl, falls Sie selbst eine wählen müssen.
Herunterladen
Sie erhalten dasselbe Dokument, jetzt mit einer verborgenen Textebene hinter dem Scan.
Eine unsichtbare Ebene über einer unveränderten Seite
Der Scan bleibt genau so, wie er war. Hinzu kommt eine Textebene in einem unsichtbaren Darstellungsmodus – echte Zeichen, Wort für Wort über den Wörtern im Bild positioniert und so gekennzeichnet, dass sie nie gezeichnet werden. Die Seite sieht identisch aus, weil sich optisch nichts geändert hat; markieren Sie einen Satz, landet die Hervorhebung auf den richtigen Wörtern, weil der unsichtbare Text genau dort liegt, wo die sichtbare Tinte ist. So wird ein durchsuchbarer Scan üblicherweise erstellt, und deshalb lässt sich das Ergebnis durchsuchen, kopieren und indexieren, obwohl es weiterhin ein Foto eines Dokuments ist.
Zwei Dinge an der Seite werden bewusst korrigiert, weil das Lesen sie ohnehin brauchte. Eine seitlich gescannte Seite wird aufgerichtet, und eine Seite, die schief durch den Einzug lief, wird begradigt – das Ergebnis ist daher oft ordentlicher als die Vorlage. Die Seitengrößen werden aus dem Original-PDF übernommen statt vereinheitlicht, sodass ein Dokument mit gemischten Seitengrößen so bleibt und nichts neu skaliert wird.
Die Genauigkeit hängt fast vollständig vom Scan ab, und die Unterschiede sind groß. Ein sauberer Scan gedruckten Textes mit 300 DPI wird mit sehr hoher Genauigkeit gelesen; dieselbe Seite mit 150 DPI deutlich schlechter; ein schräg aufgenommenes Foto bei schlechtem Licht ist eine ganz andere Sache. Wenn Sie selbst scannen, sind 300 DPI in Graustufen die entscheidende Einstellung – mehr Auflösung hilft selten, weniger schadet sofort. Kleine Schrift, enger Zeilenabstand, farbige Hintergründe, Kopien von Kopien und alles Gestempelte oder Handschriftliche sind auf eine Weise schwieriger, die keine Software vollständig löst.
Was bewusst weggelassen wird, ist genauso wichtig wie das, was hineinkommt. Fotos, Logos, Unterschriften und dekorative Grafiken werden ignoriert statt gelesen, denn wer einem Bild Buchstaben abzwingt, erhält plausiblen Unsinn, der dann in jeder Suche auftaucht. Chinesische, japanische und koreanische Wörter werden erkannt, aber aus der Textebene ausgelassen und für Sie gezählt, statt als Leerstellen geschrieben zu werden, bis eine Schrift verfügbar ist, die sie darstellen kann. Das Dokument wird hier nicht neu gesetzt: Die Wörter auf der Seite sind weiterhin ein Bild, und die Umwandlung in Word ist das Tool, um daraus bearbeitbaren Text zu machen.
Wenn Sie etwas anderes brauchen
OCRmyPDF ist das Tool, neben dem diese Seite eine bequeme Abkürzung ist, und es ist kostenlos. ocrmypdf --deskew --rotate-pages in.pdf out.pdf erledigt dieselbe Aufgabe mit mehr Kontrolle; mit --optimize 3 wird das Ergebnis verkleinert, mit --redo-ocr eine schlechte vorhandene Textebene ersetzt und mit --output-type pdfa im selben Durchgang eine Archivdatei erzeugt. Es verarbeitet Tausende Seiten, läuft als Ordnerüberwachung und wird von Bibliotheken und Dokumentarchiven tatsächlich eingesetzt.
Bei schwierigem Material – historischen Drucken, ungewöhnlichen Layouts, umfangreichen Tabellen – liest ein gehosteter Dienst von Google, Amazon oder Microsoft Seiten, an denen eine allgemeine Texterkennung scheitert, weil er mit weit mehr Material trainiert wurde. Das ist ein echter Unterschied in den Fähigkeiten, und das sollte man wissen. Es bedeutet aber auch, Ihre Dokumente an einen Dritten zu senden – genau der Kompromiss, den diese Seite vermeiden soll. Für ein fragiles altes Buch ist es also die richtige Wahl, für einen Karton voller Patientenakten die falsche.
Häufig gestellte Fragen
Sehen die Seiten danach anders aus?
Nur gerader: Eine Seite, die ein Grad schief oder seitlich gescannt wurde, wird aufgerichtet. Der Scan selbst bleibt erhalten, und die erkannten Wörter werden in unsichtbarer Tinte darübergelegt – nie gezeichnet, nie gedruckt. Was sich ändert: Strg+F findet plötzlich etwas.
Wird mein Dokument irgendwo gespeichert?
Nein. Bei der Texterkennung wird nichts gespeichert. Die Erkennungssoftware und das Sprachpaket werden beim ersten Gebrauch einer Sprache von dieser Website geladen; das Dokument selbst verlässt Ihr Gerät nie.
Wie genau ist die Erkennung?
Bei sauberen Scans gedruckter Texte sehr genau. Verschwommene Fotos, Handschrift und ungewöhnliche Schriften verringern die Genauigkeit; Schieflagen werden vor dem Lesen korrigiert. Tabellen mit Linien werden Zelle für Zelle gelesen, sodass Formularbeschriftungen nicht mit ihren Werten verschmelzen.
Welche Sprachen funktionieren?
Über 120, darunter Englisch, Bengalisch, Hindi, Urdu, Arabisch, Spanisch, Französisch, Chinesisch, Japanisch und Koreanisch. Die Schrift wird anhand der Seite erkannt; teilen sich mehrere Sprachen eine Schrift, entscheidet die Sprache Ihres Browsers, und Sie können sie ändern.
In der Textebene fehlen einige Wörter. Warum?
Die Textebene kann nur Zeichen enthalten, die eine mitgelieferte Schrift darstellen kann. Bengalisch, Devanagari, Arabisch, Thai und zwei Dutzend weitere Schriften haben hier eine eigene Schrift; Chinesisch, Japanisch und Koreanisch noch nicht, daher werden diese Wörter für Sie gezählt, statt als Leerstellen gespeichert zu werden. „PDF in Word“ mit OCR liefert Ihnen diesen Text vollständig.
Wie lange dauert es?
Einige Sekunden pro Seite, weil Ihr eigenes Gerät das Lesen übernimmt und keine Serverfarm. Der Fortschritt wird Seite für Seite angezeigt.
Gut zu wissen: Chinesische, japanische und koreanische Wörter werden aus der Textebene ausgelassen und für Sie gezählt, statt als Leerstellen gespeichert zu werden, bis eine passende Schrift verfügbar ist; jede andere Schrift, die die Erkennung beherrscht, wird geschrieben. Fotos, Logos und Unterschriften werden ignoriert, damit daraus nie unsinniger Text wird. Handschrift erkennt kein allgemeines OCR-Tool zuverlässig.
Dieses Tool auf Ihrer Website einbinden
Kostenlos für jeden Blog, jede Kursseite und jeden Hilfeartikel. Fügen Sie ein einziges Snippet ein, und Ihre Besucher können das Tool direkt auf Ihrer Seite nutzen.
Weitere PDF-Tools
PDF in Word
In bearbeitbare .docx umwandeln, mit OCR für Scans
PDF in Text
Nur-Text zum Kopieren und Bearbeiten
PDF verkleinern
Kleinere Datei, gleiches Dokument
Druckfertiges PDF
Einheitliches Format, Beschnitt und Schnittmarken
PDF schützen
Mit Passwort verschlüsseln, AES-256
PDF entsperren
Ein Passwort entfernen, das Sie bereits kennen