Zum Inhalt springen

Ein PDF richtig schwärzen

Ein schwarzes Rechteck über Text ist keine Schwärzung. Die Wörter stehen weiterhin in der Datei, und jeder kann sie in etwa vier Sekunden lesen. So funktioniert es wirklich – und so prüfen Sie, dass es geklappt hat.

Zuletzt geprüft am

Der Fehler – und warum er immer wieder passiert

Eine PDF-Seite ist ein Zeichenprogramm. Text ist eine Anweisung, bestimmte Zeichen an bestimmte Koordinaten zu setzen, und ein schwarzes Rechteck ist eine weitere Anweisung, eine Fläche zu füllen. Das Rechteck entfernt den Text nicht – es wird darübergezeichnet. Die Zeichen stehen weiterhin darunter in der Datei, und wer den Bereich markiert, kopiert sie heraus. Jedes kostenlose Tool extrahiert sie in Sekunden.

Der Fehler passiert immer wieder, weil die Oberfläche Ihnen sagt, dass es geklappt hat. Sie ziehen einen Balken, die Wörter verschwinden, Sie speichern die Datei, und sie sieht genau wie ein geschwärztes Dokument aus. Kein Fehler, keine Warnung und kein sichtbarer Unterschied zu einer korrekten Schwärzung. Jede veröffentlichte Schwärzungspanne, von der Sie gelesen haben – ungeschwärzte Gerichtsakten, Vergleichssummen, Zeugennamen, ein Geheimdienstbericht, dessen Löschungen binnen Minuten wiederhergestellt waren –, ging auf jemanden zurück, der eine Form gezeichnet und ihr vertraut hat.

Den Text schwarz hervorzuheben, ist derselbe Fehler in anderem Gewand – ebenso, ihn in einer Textverarbeitung vor dem PDF-Export mit einem weißen Rechteck abzudecken.

Was echtes Schwärzen bewirkt

Die Reihenfolge ist umgekehrt. Zuerst wird der Text aus dem Seiteninhalt gelöscht, danach wird der schwarze Balken als sichtbare Markierung gezeichnet, wo etwas stand. Kopieren Sie den geschwärzten Bereich, erhalten Sie nichts, weil nichts da ist; extrahieren Sie den Seitentext, sind die Wörter schlicht nicht vorhanden.

Genau das macht PDF schwärzen hier, und es meldet, wie viele Textstücke entfernt wurden. Das ist wichtig, denn eine Schwärzung, die nichts getroffen hat, sieht genauso aus wie eine, die funktioniert hat. Wenn Sie einen Balken über einen Namen gezogen haben und nichts entfernt wurde, ist der Name vermutlich Teil eines Bildes statt Text – dann brauchen Sie den nächsten Abschnitt.

Text in Bildern ist ein eigenes Problem

Ein Name auf einer gescannten Seite oder in einem Screenshot, der in einen Bericht eingefügt wurde, ist überhaupt kein Text – es sind Pixel. Text zu löschen, erreicht ihn nicht, und ein darübergezogener Balken ist genau die wirkungslose Abdeckung von oben, weil die Pixel darunter in den Bilddaten erhalten bleiben.

Die Lösung ist, diese Seiten mit angewandter Schwärzung neu zu rendern, sodass die Pixel tatsächlich nicht mehr existieren. Das hat einen echten Preis, den Sie kennen sollten: Diese Seiten werden zu Bildern, jeglicher Text darauf ist nicht mehr markierbar, und die Datei wird größer. Bei einem gescannten Dokument ändert das nichts, es bestand ja schon aus Bildern. Bei einem gemischten Dokument ist es eine Abwägung.

Dasselbe gilt für Bilder allgemein. Wenn Sie ein Gesicht oder ein Nummernschild unkenntlich machen, dann so stark, dass der Bereich keinerlei sichtbare Struktur mehr trägt – Forscher haben Text aus schwacher Verpixelung rekonstruiert, indem sie Kandidaten erzeugt und abgeglichen haben. Wenn Sie noch erraten können, wie viele Zeichen dort standen, ist es nicht stark genug.

Wo ein PDF vergessene Namen aufbewahrt

Hier stolpern selbst diejenigen, die korrekt geschwärzt haben. Ein PDF speichert Text an mehr Stellen als auf der sichtbaren Seite, und eine perfekte Schwärzung der Seite lässt jede davon unberührt.

Die Lesezeichenstruktur enthält häufig Abschnittstitel mit Namen darin. Werte von Formularfeldern bleiben erhalten, selbst wenn das Feld nicht sichtbar ist. Dateianhänge können ganze Dokumente sein, die im PDF versteckt sind. Die Dokumentinformationen und das XMP-Metadatenpaket enthalten Titel, Autor, Software und oft den ursprünglichen Dateipfad – der einen Benutzernamen und eine Ordnerstruktur verrät. Kommentare und Anmerkungen haben ihren eigenen Text und den Namen ihres Verfassers. Und der Dateiname selbst reist überallhin mit dem Dokument mit.

Eine Stelle gibt es noch, und sie ist die unauffälligste: Ein inkrementell gespeichertes PDF behält seine früheren Versionen in derselben Datei. Wurde ein Dokument bearbeitet und gespeichert statt neu geschrieben, kann eine frühere Version einer Seite noch darin stecken. Deshalb ist der Prüfschritt unten bei allem, worauf es ankommt, nicht optional.

Prüfen – und wie

Die Prüfung ist der Schritt, den alle überspringen, und der, der Sie tatsächlich schützt. Drei Kontrollen, zunehmend gründlich.

Öffnen Sie das Ergebnis und versuchen Sie, den geschwärzten Bereich zu markieren. Lässt sich irgendetwas kopieren, hören Sie auf. Das deckt den grundlegenden Fehler in fünf Sekunden auf und lohnt sich jedes einzelne Mal.

Sehen Sie sich die Dokumenteigenschaften an. Titel, Autor, Betreff und Stichwörter sind in jedem PDF-Reader unter Datei und dann Eigenschaften sichtbar. Steht im Autorfeld der Name, den Sie gerade eine Stunde lang entfernt haben, hat die Schwärzung nichts gebracht.

Bauen Sie die Datei neu auf. Wenn Sie das Ergebnis durch ein Tool schicken, das das Dokument aus dem neu schreibt, worauf seine Seiten tatsächlich verweisen – Ghostscript mit gs -sDEVICE=pdfwrite oder qpdf --empty --pages out.pdf 1-z -- –, werden nicht referenzierte Objekte und frühere Versionen verworfen. Zusätzlich löscht exiftool -all:all= die Metadaten. Bei einem Gerichtsschriftsatz oder allem, was offengelegt wird, machen Sie alle drei Schritte und lassen jemand anderen gegenprüfen.

Eine Seite zu löschen, ist auch keine Schwärzung

Das verdient einen eigenen Abschnitt, denn es ist derselbe Typ Fehler. PDF-Seiten löschen baut ein neues Dokument aus den Seiten auf, die Sie behalten – aber ein Link auf einer behaltenen Seite, der auf eine gelöschte Seite zeigte, muss weiterhin auflösbar sein. Dadurch landet eine Kopie der gelöschten Seite als Objekt in der neuen Datei, auf das kein Seitenbaum verweist. In jedem Reader unsichtbar, in den Bytes vorhanden.

Um eine Seite aus dem Blickfeld zu entfernen, ist Löschen richtig und ausreichend. Um ihren Inhalt aus der Welt zu schaffen, löschen Sie die Seite und bauen die Datei wie oben beschrieben neu auf.

Häufig gestellte Fragen

Ist ein schwarzer Balken jemals in Ordnung?

Nur als sichtbare Markierung über einer echten Schwärzung. Allein verbirgt er die Wörter vor einem Leser, der nicht genau hinsieht, und vor niemandem sonst. Wird das Dokument veröffentlicht, eingereicht oder offengelegt, behandeln Sie einen Balken allein als gar keine Schwärzung.

Und wenn ich das PDF stattdessen abflache?

Abflachen brennt Anmerkungen in die Seite ein, wodurch ein gezeichneter Balken tatsächlich dauerhaft zur Grafik wird – doch der Text darunter ist Seiteninhalt, keine Anmerkung, und bleibt daher erhalten. Abflachen ist das richtige Tool, um Formulareingaben und Unterschriften festzuschreiben, nicht um Wörter zu verbergen.

Kann ich schwärzen, indem ich das PDF in Bilder umwandle?

Das funktioniert insofern, als ein Bild einer Seite mit einem Balken darauf tatsächlich keinen Text darunter hat. Die Nachteile sind real: Das Dokument ist nicht mehr durchsuchbar, die Datei wächst, und die Metadaten werden meist trotzdem mitgenommen – die müssen Sie also weiterhin separat bereinigen.

Entfernt das Drucken als PDF versteckten Text?

Beim Seiteninhalt meist ja, weil die Seite neu gerendert wird – deshalb klappt es manchmal zufällig. Eine verlässliche Methode ist es nicht: Es löscht nicht jedes Metadatenfeld und hängt vom Druckertreiber ab. Nutzen Sie ein Tool, das angibt, was es entfernt.

Ist es sicher, ein vertrauliches Dokument auf einer Website zu schwärzen?

Auf dieser Website wird zu keinem Zeitpunkt etwas gespeichert – und genau deshalb wird Schwärzen hier überhaupt angeboten: Die Dokumente, die Menschen schwärzen müssen, sind genau die, die nicht auf dem Server eines Fremden liegen sollten. Für einen juristischen Schriftsatz nutzen Sie Software, die für diese Tragweite gebaut ist, und prüfen das Ergebnis selbst.