Zuletzt geprüft:
Findet die Suche kein sichtbar vorhandenes Wort, fehlt der PDF häufig eine brauchbare Textebene. Suche zuerst nach einem kurzen, eindeutig lesbaren Begriff und versuche danach, einzelne Buchstaben mit der Maus zu markieren. Lässt sich nur die ganze Seite wie ein Bild auswählen, handelt es sich sehr wahrscheinlich um einen Scan ohne Texterkennung. Ist Text markierbar, führen die Zeichenzuordnung, eine fehlerhafte OCR oder die Sucheinstellungen zur nächsten Spur.
Drei Tests trennen die häufigsten Fehlerbilder
Die Volltextsuche wertet nicht das sichtbare Seitenbild aus. Sie greift auf Zeichen zurück, die in der PDF gespeichert oder durch eine OCR-Texterkennung erzeugt wurden. Mit dieser Reihenfolge lässt sich eingrenzen, an welcher Stelle die Suche scheitert:
- Öffne die Suchfunktion mit Strg + F unter Windows beziehungsweise Befehl + F unter macOS. Suche nach einem kurzen Wort, das vollständig in einer Zeile steht und keine Umlaute oder Sonderzeichen enthält.
- Versuche, genau dieses Wort Buchstabe für Buchstabe zu markieren. Wird stattdessen ein rechteckiger Bildbereich oder die gesamte Seite erfasst, fehlt die Textebene.
- Kopiere den markierten Text in einen einfachen Texteditor. Erscheint dort das richtige Wort, liegt die Ursache eher beim Suchbegriff, Suchbereich oder verwendeten PDF-Programm. Erscheinen falsche Zeichen oder unleserliche Folgen, ist die interne Zeichenzuordnung beschädigt oder ungeeignet.
Funktioniert die Suche in einem anderen PDF-Programm, ist die Datei grundsätzlich durchsuchbar. Dann muss sie nicht sofort neu erstellt werden; häufig genügt ein anderer Betrachter oder eine Prüfung der Suchoptionen.
Das Seitenbild besitzt keine Textebene
Ein gescanntes Blatt kann in einer PDF wie normaler Text aussehen, technisch aber ausschließlich aus Pixeln bestehen. Strg + F beziehungsweise Befehl + F kann darin keine Wörter erkennen. Das gilt auch für PDFs, die aus Fotos, Bildschirmaufnahmen oder eingescannten Briefen zusammengesetzt wurden.
Abhilfe schafft eine optische Zeichenerkennung, kurz OCR. Sie analysiert das Seitenbild und legt erkannten Text als durchsuchbare Ebene darüber oder erzeugt eine neue PDF mit Textinhalt. In Adobe Acrobat befindet sich diese Funktion je nach Programmversion und Oberfläche im Werkzeugbereich unter einer Bezeichnung wie Scannen und OCR. Die Texterkennung gehört nicht in jeder Acrobat- oder Reader-Ausgabe zum kostenlosen Funktionsumfang.
Wähle bei der OCR die Sprache des Dokuments passend aus. Bei gemischten Sprachen, schwachem Kontrast, schiefen Seiten oder ungewöhnlichen Schriften sind anschließend Stichproben nötig. Eine erfolgreich abgeschlossene OCR bedeutet nicht automatisch, dass jedes Wort richtig erkannt wurde.
Text ist vorhanden, aber intern falsch zugeordnet
Eine PDF kann Buchstaben korrekt darstellen und trotzdem unbrauchbare Textdaten enthalten. Das passiert beispielsweise bei fehlerhaft eingebetteten Schriften, ungewöhnlichen Zeichenkodierungen oder einem problematischen PDF-Export. Die Suche arbeitet mit den intern gespeicherten Zeichen, nicht mit dem Aussehen der Buchstaben.
Der Kopiertest macht dieses Fehlerbild sichtbar: Wird aus einem lesbaren Wort nach dem Einfügen eine Folge falscher Buchstaben, Leerzeichen oder Sonderzeichen, sollte die PDF möglichst aus der ursprünglichen Datei neu exportiert werden. Das ist meist sauberer als eine nachträgliche Reparatur. Die Ausgangsanwendung sollte dabei Schriften korrekt einbetten und echten Text exportieren, statt Seiten in Bilder umzuwandeln.
Fehlt die Quelldatei, kann eine erneute OCR auf einer Arbeitskopie helfen. Dabei wird der sichtbar dargestellte Inhalt neu erkannt. Vorhandene Formularfelder, Ebenen, Lesezeichen oder andere interaktive Elemente können je nach Werkzeug jedoch verändert werden. Das Ergebnis sollte nicht ungeprüft die ursprüngliche Datei ersetzen.
Die OCR erkennt nur Teile des Dokuments
Bleiben einzelne Seiten oder Wörter unauffindbar, ist oft eine unvollständige oder fehlerhafte Texterkennung verantwortlich. Typische Störfaktoren sind schräg eingezogene Seiten, Schatten am Buchfalz, niedriger Kontrast, kleine Schrift, handschriftliche Ergänzungen, mehrspaltige Anordnungen und Text auf gemustertem Hintergrund.
- Werden nur bestimmte Seiten nicht gefunden, prüfe dort Auswahl und Kopierergebnis getrennt.
- Treffen Fehler vor allem Umlaute oder Akzente, kontrolliere die bei der OCR gewählte Dokumentsprache.
- Fehlen Wörter am Seitenrand, sollte der Scan auf abgeschnittene Buchstaben oder starke Verzerrungen geprüft werden.
- Ist die Seite gedreht oder schief, richte sie vor einer erneuten Erkennung aus.
- Bei blassem Text verbessert eine besser lesbare Ausgangsdatei das Ergebnis stärker als mehrfaches Erkennen derselben schlechten Vorlage.
Für Verträge, Rechnungen oder andere inhaltlich wichtige Unterlagen reicht eine kurze Stichprobe nicht immer aus. Suche zusätzlich nach Namen, Datumsangaben und Fachbegriffen aus verschiedenen Bereichen des Dokuments.
Der Suchbegriff stimmt nicht mit dem gespeicherten Text überein
Die Datei kann technisch in Ordnung sein, obwohl eine ganze Wortgruppe keinen Treffer ergibt. Zeilenumbrüche, Trennstriche, Ligaturen und unterschiedliche Schreibweisen beeinflussen die Suche. Ein am Zeilenende getrenntes Wort kann intern mit Bindestrich, ohne Bindestrich oder als zwei Textteile gespeichert sein.
Suche in diesem Fall nur nach einem markanten Wortteil. Deaktiviere außerdem Optionen wie Groß- und Kleinschreibung oder Suche nach ganzen Wörtern, falls der verwendete Betrachter solche Einstellungen anbietet. Bei einer Phrase über zwei Zeilen sollten die einzelnen Wörter getrennt geprüft werden. Für Zahlen lohnt sich ein zweiter Versuch ohne Leerzeichen, Tausendertrennzeichen oder vorangestellte Währungssymbole.
Browser und PDF-Programm liefern unterschiedliche Ergebnisse
In Browsern integrierte PDF-Anzeigen besitzen meist eine einfache Suche, verarbeiten umfangreiche oder ungewöhnlich aufgebaute Dokumente aber nicht immer genauso wie ein eigenständiges PDF-Programm. Lade eine zulässige Datei lokal herunter und öffne sie testweise in einem etablierten Desktop-Reader. Wird das Wort dort gefunden, liegt der Unterschied am Betrachter und nicht an einer fehlenden Textebene.
Bei großen Dateien sollte die PDF zunächst vollständig geladen sein. Besteht das Dokument aus mehreren eingebetteten Dateien oder einem PDF-Portfolio, durchsucht die einfache Funktion unter Umständen nur das gerade geöffnete Dokument. Eine erweiterte Suche über mehrere Dateien ist eine eigene Programmfunktion und nicht in jedem Browser-Betrachter vorhanden.
Die passende Reparatur aus dem Testergebnis ableiten
- Nichts lässt sich als Text markieren: OCR auf einer Kopie ausführen und die richtige Dokumentsprache wählen.
- Markieren klappt, Kopieren erzeugt falsche Zeichen: PDF aus der Quelldatei neu exportieren oder ersatzweise eine OCR-Kopie erstellen.
- Kopierter Text ist korrekt, die Suche bleibt erfolglos: kürzeren Suchbegriff verwenden, Suchoptionen prüfen und die Datei in einem anderen PDF-Programm testen.
- Nur einzelne Seiten sind betroffen: Seitenausrichtung, Scanqualität und OCR-Ergebnis genau auf diesen Seiten kontrollieren.
- Nur der Browser findet nichts: Datei lokal in einem Desktop-Reader öffnen, bevor sie verändert wird.
Nach jeder Reparatur sollte ein kurzer Erfolgstest folgen: Suche nach mehreren Wörtern auf unterschiedlichen Seiten, markiere einen Satz und kopiere ihn in einen Texteditor. Erst wenn Darstellung, Suchtreffer und kopierter Inhalt zusammenpassen, ist die Textebene verlässlich nutzbar.
Häufige Fragen zur Volltextsuche in PDF-Dateien
Kann eine OCR die Dateigröße erhöhen?
Ja. Eine zusätzliche Textebene und gegebenenfalls neu verarbeitete Seitenbilder können die PDF vergrößern. Wie stark sich die Größe verändert, hängt vom OCR-Werkzeug, der Bildauflösung und der Komprimierung ab. Bewahre die Ausgangsdatei auf, bis Suchqualität und Darstellung der neuen Version geprüft sind.
Darf eine digital signierte PDF nachträglich per OCR bearbeitet werden?
Eine nachträgliche Texterkennung verändert den Dateiinhalt und kann die Gültigkeitsanzeige einer vorhandenen digitalen Signatur beeinträchtigen. Führe die OCR nur an einer Kopie aus und behalte das signierte Original unverändert. Ein eingefügtes Bild einer Unterschrift ist davon zu unterscheiden und stellt keine kryptografische Signaturprüfung bereit.
Sind Online-OCR-Dienste für vertrauliche PDFs geeignet?
Bei Personalunterlagen, Verträgen, Gesundheitsdaten oder internen Geschäftsdokumenten ist eine lokale Verarbeitung die sicherere Wahl. Bei einem Online-Dienst wird die Datei auf fremde Systeme übertragen. Ohne belastbare Angaben zu Speicherort, Löschung und Verarbeitung sollte eine vertrauliche PDF dort nicht hochgeladen werden.