Text in einer PDF gezielt schwärzen
Übergeben Sie eine gültige Base64-kodierte PDF und einen nicht leeren Suchtext, damit passende Textstellen geschwärzt werden können. Bei Erfolg erhalten Sie eine bearbeitete PDF in Base64-Form sowie Zählwerte für Seiten und gefundene Vorkommen.
Geeignete PDF-Inhalte auswählen
Mit diesem Werkzeug können Sie gezielt nach einem Text in einer PDF suchen und die gefundenen Bereiche schwärzen. Die Suche bezieht sich auf den durchsuchbaren Seitentext der PDF. Das ist passend, wenn sensible Angaben als echter Text vorliegen, gilt aber nicht für Inhalte, die ausschließlich in einem Bild gespeichert sind oder erst durch OCR erkannt werden müssten.
Für die Verarbeitung übergeben Sie die Datei in der erwarteten technischen Form und legen einen Suchwert fest. Bei erfolgreicher Verarbeitung entsteht eine Base64-kodierte PDF mit angewendeten Schwärzungen. Zusätzlich nennt das Ergebnis die Zahl der verarbeiteten Seiten und die Zahl der gefundenen Vorkommen. Diese Angaben helfen Ihnen, den Verarbeitungsausgang vor der weiteren Verwendung zu kontrollieren.
PDF-Text in fünf Schritten schwärzen
-
Bereiten Sie die Datei vor. Die Dateieingabe muss eine Base64-kodierte PDF enthalten. Nach dem Dekodieren müssen die Bytes mit der PDF-Signatur beginnen. Fehlt die Datei, lässt sie sich nicht als Base64-Inhalt dekodieren oder beginnt der dekodierte Inhalt nicht mit dieser Signatur, wird die Verarbeitung abgebrochen.
-
Bestimmen Sie den Suchtext. Tragen Sie die Zeichenfolge ein, deren passende Stellen entfernt werden sollen. Der Suchwert darf nicht leer sein; bei einem leeren Wert schlägt der Vorgang bereits vor der PDF-Verarbeitung fehl. Wählen Sie daher einen tatsächlich im durchsuchbaren Seitentext vorhandenen Begriff oder eine passende Textfolge. Prüfen Sie bei zusammengesetzten Angaben außerdem, ob die PDF den gewünschten Inhalt als zusammenhängenden Text ausgibt.
-
Legen Sie optional einen Ersatzwert fest. Der standardmäßige Ersatzwert ist ein Blockzeichen. Dieses Zeichen sollte nicht mit einem automatisch als Anmerkungs-Ersatztext eingesetzten sichtbaren Zeichen gleichgesetzt werden. Wenn an der geschwärzten Stelle ein eigener Ersatztext verwendet werden soll, geben Sie dafür ASCII-Zeichen an, zum Beispiel
REDAKTIERT. Ein nicht-ASCII-Ersatzwert wird nicht als Anmerkungs-Ersatztext übergeben. -
Starten Sie den Vorgang. Das Werkzeug durchsucht die Seiten der übergebenen PDF nach dem Suchtext und wendet auf die passenden Regionen Schwärzungen an. Es verarbeitet dabei nur Text, der auf der PDF-Seite durchsuchbar vorliegt; eine Bildanalyse gehört nicht zu diesem Suchweg.
-
Nehmen Sie die Ausgabe entgegen. Bei erfolgreichem Verlauf erhalten Sie eine Base64-kodierte PDF. Lesen Sie zusätzlich die Zahl der verarbeiteten Seiten und die Zahl der gefundenen Vorkommen aus. Bewahren Sie für einen Vergleich den ursprünglichen Suchwert und den verwendeten Ersatzwert getrennt von der Ausgabedatei auf.
Trefferzahlen und Ausgabe beurteilen
Eine erfolgreiche Antwort enthält eine PDF, in der die gefundenen Bereiche durch angewendete Schwärzungen entfernt wurden. Die Ausgabe bleibt dabei in der technischen Base64-Form, sodass Sie sie zunächst wieder als PDF weiterverarbeiten müssen.
Die Seitenzahl beschreibt, wie viele Seiten verarbeitet wurden, während die Vorkommenszahl die gefundenen Treffer des Suchtexts angibt. Eine Vorkommenszahl von null bedeutet, dass kein passender Text gefunden wurde; sie bestätigt nicht, dass ein ähnlich aussehender Begriff als Treffer erkannt wurde. Vergleichen Sie deshalb den Suchwert mit dem tatsächlich extrahierten Seitentext und kontrollieren Sie die erzeugte PDF vor der Weitergabe.
Bleibt ein Begriff trotz sichtbarer Darstellung unberücksichtigt, liegt er möglicherweise nur als Bildinhalt vor. Auch Text, der erst durch OCR zugänglich würde, gehört nicht zur durchsuchbaren Seitentextbasis dieses Vorgangs. In solchen Fällen muss die PDF zunächst eine durchsuchbare Textschicht enthalten, bevor dieser Suchweg den Begriff erfassen kann.
Ein Fehler bei der Datei weist auf die erwartete Eingabeform hin: Es wird keine beliebige Datei verarbeitet, sondern eine Base64-kodierte Eingabe, deren dekodierte Bytes mit der PDF-Signatur beginnen. Ein leerer Suchwert ist davon unabhängig und beendet den Vorgang bereits vor der Prüfung des PDF-Inhalts.
Praktisches Beispiel
Sie möchten das Wort Geburtsdatum in einer durchsuchbaren PDF entfernen und an den gefundenen Stellen den ASCII-Ersatztext REDAKTIERT verwenden.
Verwenden Sie eine gültige Base64-kodierte PDF, suchen Sie nach Geburtsdatum und wählen Sie REDAKTIERT als ASCII-Ersatztext. Starten Sie anschließend die Verarbeitung und prüfen Sie, ob die Antwort eine PDF und beide Zählwerte enthält.
Das Ergebnis enthält eine Base64-kodierte PDF mit angewendeter Schwärzung sowie die Zahl der verarbeiteten Seiten und der gefundenen Vorkommen.
Einschränkungen
- Die Verarbeitung setzt eine gültige PDF in der erwarteten Base64-Form voraus und erfasst nur durchsuchbaren Seitentext, nicht ausschließlich bildbasierte Inhalte.
Häufige Fehler
- Ursache: Der Suchwert ist leer oder die gesuchte Angabe liegt nur als Bild vor. Korrektur: Verwenden Sie einen nicht leeren Suchtext und prüfen Sie, ob die PDF den Inhalt als durchsuchbaren Seitentext enthält.
Häufige Fragen
Kann das Werkzeug Text in gescannten Bildern schwärzen?
Das ist nur möglich, wenn der Inhalt als durchsuchbarer PDF-Seitentext vorliegt. Text, der ausschließlich in einem Bild steckt oder erst durch OCR erkannt werden müsste, wird bei dieser Suche nicht erfasst.
Muss ich einen Ersatztext angeben?
Ein eigener Ersatzwert ist nicht zwingend erforderlich, sofern der Standardwert verwendet werden soll. Der Standardwert ist ein Blockzeichen; für einen eigenen Anmerkungs-Ersatztext sollten Sie ASCII-Zeichen eingeben, weil ein nicht-ASCII-Wert nicht als solcher übergeben wird.
Was erhalte ich nach einer erfolgreichen Verarbeitung?
Vorausgesetzt, die Verarbeitung war erfolgreich, enthält das Ergebnis eine Base64-kodierte PDF mit angewendeten Schwärzungen sowie die Zahl der verarbeiteten Seiten und der gefundenen Vorkommen.