Zum Inhalt springen

Text aus einem Bild auslesen

Lesen Sie die Wörter aus einem Foto, einem Scan oder einem Screenshot und nehmen Sie sie als Text mit, den Sie bearbeiten, durchsuchen und einfügen können. Das Bild wird nie gespeichert.

  • Nie gespeichert
  • Keine Warteschlange, kein Warten
  • Ohne Anmeldung, ohne Wasserzeichen

So funktioniert’s

1

Bild hinzufügen

JPG, PNG, WebP, GIF, BMP, ein HEIC vom iPhone oder ein TIFF vom Scanner. Ein schräg aufgenommenes Foto wird begradigt und seine Ausleuchtung angeglichen, bevor es gelesen wird.

2

Sprache prüfen

Die Schrift wird aus dem Bild erkannt und die Sprache für Sie gewählt. Über 120 stehen zur Auswahl, falls die Vermutung falsch war oder das Bild mehrere Sprachen enthält.

3

Kopieren oder herunterladen

Behalten Sie das Layout mit Zeilen und Spalten an ihrem Platz, oder fügen Sie die Zeilen zu fließenden Absätzen zusammen, bereit zum Einfügen an anderer Stelle.

Wie das Bild gelesen wird

Die Größe, die die Erkennung braucht, wird an der Schrift gemessen, nicht an der Datei. Die Höhe einer Textzeile wird aus dem Bild selbst geschätzt, und alles wird so skaliert, dass eine Zeile bei etwa vierunddreißig Pixeln landet – ein kleiner Screenshot wird bis zum Vierfachen vergrößert, ein riesiges Foto verkleinert, wobei die längste Seite in beiden Fällen begrenzt ist. Deshalb ist ein Foto einer Speisekarte mit neun Megapixeln nicht genauer als ein scharfes kleines, und deshalb überspringt ein Bild mit weniger als etwa dreihundert Pixeln an der kürzesten Seite die Spracherkennung ganz und wird als lateinische Schrift gelesen. Davor wird das Papier hinter der Schrift abschnittsweise geschätzt und herausgerechnet, um die Ausleuchtung anzugleichen, die Schräglage der Seite über ihre gesamte Höhe gemessen und gerade gedreht, und das Ergebnis mit einem einzigen globalen Schwellenwert auf Schwarz-Weiß reduziert.

Die Wahl der Sprache ist ein Vorsprechen, kein Nachschlagen, denn der übliche Detektor erkennt gar keine Sprachen. Der erste Durchgang meldet die Schrift und die Drehung, sonst nichts; die Schrift grenzt die Auswahl ein, die Spracheinstellungen Ihres Browsers entscheiden zwischen Sprachen mit derselben Schrift, und dann wird jeder Kandidat tatsächlich eingesetzt, um eine verkleinerte Kopie des Bildes zu lesen, und danach bewertet, wie viele sicher erkannte Wörter er liefert. Der Gewinner liest die echte Seite, und der erkannte Text wird noch einmal geprüft – auf diakritische Zeichen, typische Buchstabenpaare, häufige kurze Wörter –, um festzustellen, ob eine andere Sprache besser abschneiden würde. Das ist die Mechanik hinter „die falsche Sprache liefert zuverlässig eine leere Seite“: Das Vorsprechen gibt es genau dafür, dass die Vermutung an Ihrem Bild getestet und nicht einfach behauptet wird.

Eines sollten Sie darüber wissen, was im Ergebnis landet. Ein Absatz, bei dem sich die Erkennung nicht sicher war, wird weggelassen statt angezeigt – Text, den Sie im Bild sehen, kann also ganz im Ergebnis fehlen, statt als Unsinn zu erscheinen. Dasselbe gilt für Bereiche, die als Bild oder Rauschen eingestuft wurden, und für einzelne Zeichen ohne Buchstaben oder Ziffern. Für gewöhnliche unsichere Wörter gibt es keinen solchen Schnitt, Fehllesungen innerhalb eines Absatzes bleiben also stehen, und es liegt an Ihnen, sie zu finden. Wenn der Sicherheitswert ordentlich ist und ein Stück der Seite einfach fehlt, ist genau das passiert.

Wenn Sie etwas anderes brauchen

Es wird nichts gespeichert, aber dies ist das eine Tool auf der Website, bei dem der erste Durchlauf nicht umsonst ist: Die Erkennung selbst umfasst ein paar Megabyte, und jedes Sprachpaket noch einmal ein bis fünf – geladen von dieser Website und dann für das nächste Mal aufbewahrt. Für eine einzelne Seite lohnt sich das Warten, für zweitausend Scans nach Zeitplan nicht – dafür ist ein Desktop-OCR-Tool wie OCRmyPDF da, das einem ganzen Ordner mit einem Befehl eine Textebene hinzufügt, ohne Download und ohne Klicken.

Drei Dinge werden hier gar nicht erst versucht, und es geht schneller, sie zu kennen, als sie zu entdecken. Die Perspektive wird nicht korrigiert – die Seite wird auf Drehung gemessen und gerade gerichtet, aber ein von der Seite aufgenommenes Foto behält seine Trapezform, deshalb lohnt sich die zusätzliche Sekunde, direkt von oben zu fotografieren. Der Schwellenwert, der Schrift von Papier trennt, ist ein einziger Wert für das ganze Bild statt einer pro Bereich, sodass bei einer halb verschatteten Seite die dunkle Hälfte verloren geht, auch nachdem die Ausleuchtung angeglichen wurde; fotografieren Sie sie lieber noch einmal bei gleichmäßigem Licht, statt dagegen anzukämpfen. Und eine Tabelle, die mit Abständen statt mit Linien gesetzt ist, hat keine Linien, die sich finden ließen – sie wird als Textspalten gelesen und übersteht das Einfügen in eine Tabelle nur mit Glück.

Häufig gestellte Fragen

Wie genau ist die Erkennung?

Bei klarem gedrucktem Text, gerade und scharf fotografiert, sehr genau – ein paar Zeichen auf tausend. Die Genauigkeit sinkt bei Unschärfe, Spiegelungen, geringem Kontrast und ungewöhnlichen Schriftarten, und die Seite zeigt Ihnen, wie sicher sich die Erkennung war, statt Sie raten zu lassen. Ist der Wert niedrig, liegt es meist am Bild: mehr Licht, weniger Schräglage und den Text formatfüllend aufnehmen – das behebt das meiste.

Wird mein Bild irgendwo gespeichert?

Nein. Das Sprachpaket wird beim ersten Verwenden einer Sprache von dieser Website geladen; das Bild selbst wird nie gespeichert und nirgendwohin gesendet – es funktioniert sogar mit ausgeschaltetem WLAN.

Welche Sprachen werden erkannt?

Über 120, darunter Englisch, Bengalisch, Hindi, Urdu, Arabisch, Spanisch, Französisch, Deutsch, Portugiesisch, Russisch, Chinesisch, Japanisch und Koreanisch. Die Schrift wird aus dem Bild selbst erkannt; wo sich mehrere Sprachen eine Schrift teilen – Lateinisch, Kyrillisch, Arabisch, Devanagari –, entscheiden die Spracheinstellungen Ihres Browsers, und Sie können die Sprache jederzeit ändern.

Bleiben Spalten und Tabellen erhalten?

Ja, wenn Sie das möchten. Tabellen mit Linien werden erkannt und Zelle für Zelle gelesen, sodass eine Beschriftung nicht mit ihrem Wert verschmilzt, und kommen als tabulatorgetrennte Zeilen zurück, die sich direkt in eine Tabelle einfügen lassen. Textspalten werden in Lesereihenfolge gelesen statt quer über die Seite. Wenn Sie stattdessen die Zeilen zusammenfügen lassen, wird diese Struktur bewusst verworfen – genau das Richtige für einen Absatz, den Sie neu umbrechen wollen.

Kann es Handschrift lesen?

Saubere, getrennte Druckschrift – Blockbuchstaben in einem Formular – klappt oft. Schreibschrift nicht, weder hier noch in einem anderen allgemeinen OCR-Tool; ehrlich gesagt ist das ein anderes Problem, das einen anderen Ansatz braucht. Es gibt eine eigene Seite für Handschrift, die das klar sagt und Ihnen zeigt, was erkannt wurde.

Welche Bildformate funktionieren?

JPG, PNG, WebP, GIF, BMP und SVG über den Browser selbst, dazu HEIC vom iPhone und TIFF vom Scanner. Ein im Hochformat aufgenommenes Handyfoto kommt richtig herum heraus, weil zuerst die Ausrichtungsangabe angewendet wird, die die Kamera gespeichert hat.

Warum wurden manche Wörter falsch erkannt?

Fast immer liegt es am Bild, nicht am Text: eine Spiegelung auf der Seite, ein Schatten Ihrer Hand, Verwacklung oder Text, der auf dem Bildschirm so klein ist, dass jeder Buchstabe nur eine Handvoll Pixel hat. Die Erkennung erhält das Bild in der Größe, in der sie am besten liest, und die Ausleuchtung wird vorher angeglichen – aber keine Aufbereitung erfindet Details, die die Kamera nicht erfasst hat.

Gibt es eine Größenbeschränkung?

Nur den Arbeitsspeicher Ihres Geräts. Es wird nichts gespeichert, also gibt es auch kein Serverlimit. Ein sehr großes Foto wird auf das verkleinert, was die Erkennung nutzen kann – ab einem gewissen Punkt kosten mehr Pixel nur Zeit und bringen keine Genauigkeit.

Gut zu wissen: Schreibschrift wird von keinem allgemeinen OCR-Tool zuverlässig erkannt, auch nicht von diesem. Text über einem Bild, stark stilisierte Schriften und sehr geringer Kontrast kommen lückenhaft heraus. Das Ergebnis ist Nur-Text: Schriftarten, Farben, Fett- und Kursivschrift werden nicht übernommen, und das Bild selbst auch nicht.

Dieses Tool auf Ihrer Website einbinden

Kostenlos für jeden Blog, jede Kursseite und jeden Hilfeartikel. Fügen Sie ein einziges Snippet ein, und Ihre Besucher können das Tool direkt auf Ihrer Seite nutzen.