Zuletzt geprüft:
Ein Scan besteht zunächst nur aus Seitenbildern. Damit du darin Wörter suchen kannst, muss eine OCR-Texterkennung den Bildinhalt analysieren und als unsichtbare Textebene im PDF speichern. Prüfe zuerst mit der Suchfunktion, ob diese Ebene wirklich fehlt: Suche nach einem deutlich lesbaren Wort aus dem Dokument. Gibt es keinen Treffer und lässt sich kein einzelnes Wort markieren, benötigt die Datei sehr wahrscheinlich OCR.
Warum die PDF-Suche bei einem Scan nichts findet
Eine normale PDF-Suche wertet gespeicherte Zeichen aus. Beim reinen Scannen landen jedoch häufig nur Pixel im Dokument – ähnlich wie bei einem Foto. Das Suchfeld kann die abgebildeten Buchstaben dann nicht als Text erfassen.
OCR steht für optische Zeichenerkennung. Die Software erkennt Buchstaben, ordnet sie zu Wörtern und legt das Ergebnis hinter dem sichtbaren Seitenbild ab. Das Aussehen des Scans bleibt bei dieser Ausgabeform weitgehend erhalten, während Suchen und Markieren möglich werden. Die Erkennung verändert den Bildtext nicht automatisch in fehlerfreien digitalen Text.
Mit OCR eine durchsuchbare Datei erzeugen
- Arbeite mit einer Kopie: Lege vor der Bearbeitung eine unveränderte Sicherung der PDF-Datei an.
- Öffne die OCR-Funktion: Suche im verwendeten PDF-Programm nach Bezeichnungen wie Texterkennung, OCR, Text erkennen oder Scan verbessern. In Adobe Acrobat befindet sich die Funktion je nach Version und Oberfläche im Werkzeugbereich für Scans; die eigentliche Texterkennung gehört nicht in jeder Produktvariante zum kostenlosen Funktionsumfang.
- Wähle alle benötigten Seiten: Bei einem mehrseitigen Dokument muss die Erkennung auf den gesamten gewünschten Seitenbereich angewendet werden. Sonst bleibt ein Teil der Datei bildbasiert.
- Stelle die Dokumentsprache ein: Für einen überwiegend deutschen Scan wählst du Deutsch. Bei mehrsprachigen Dokumenten sollte die Auswahl die tatsächlich vorkommenden Sprachen abdecken, sofern das Programm mehrere Erkennungssprachen unterstützt.
- Behalte das Seitenbild mit Textebene: Eine Ausgabe mit durchsuchbarem Bild eignet sich, wenn das ursprüngliche Erscheinungsbild erhalten bleiben soll. Eine Umwandlung in bearbeitbaren Fließtext kann dagegen Tabellen, Spalten, Schriften und Abstände verändern.
- Speichere unter einem neuen Dateinamen: So kannst du das OCR-Ergebnis mit dem ursprünglichen Scan vergleichen und bei Fehlern zurückkehren.
Die Menünamen unterscheiden sich zwischen Programmversionen. Fehlt die Funktion, prüfe in der Hilfe des Programms die Rubrik zu OCR oder Texterkennung und kontrolliere, ob deine Lizenz diese Verarbeitung einschließt.
Der Suchtest zeigt, ob die Erkennung funktioniert hat
Öffne die neu gespeicherte Datei und suche nach mehreren charakteristischen Wörtern: einem Namen, einem längeren Begriff aus dem Fließtext und einer Zahl. Teste nicht nur die erste Seite. Markiere zusätzlich ein Wort mit dem Textauswahlwerkzeug und kopiere es probeweise in einen Texteditor.
- Werden die Wörter gefunden und korrekt kopiert, ist die Textebene verwendbar.
- Findet die Suche nur Begriffe auf einzelnen Seiten, wurde möglicherweise nicht der gesamte Seitenbereich verarbeitet.
- Führt ein sichtbares Wort zu keinem Treffer, hat OCR diese Stelle wahrscheinlich falsch erkannt.
- Entsteht beim Kopieren eine falsche Zeichenfolge, liegt zwar eine Textebene vor, ihre Qualität reicht an dieser Stelle aber nicht aus.
Die Anzeige allein ist keine Erfolgskontrolle: Weil das ursprüngliche Seitenbild sichtbar bleibt, kann das PDF unverändert aussehen, obwohl die dahinterliegende Erkennung Fehler enthält.
Schlechte Treffer gezielt verbessern
Die OCR-Qualität hängt stark von der Vorlage ab. Kleine Schrift, Schatten am Buchfalz, schiefe Seiten, Flecken, handschriftliche Ergänzungen und starke Komprimierung erschweren die Zuordnung. Bei Tabellen oder mehreren Spalten kann außerdem die Lesereihenfolge falsch ausfallen.
Gehe abhängig vom Ergebnis vor:
- Bei vielen falschen Umlauten oder Wortformen kontrollierst du zuerst die eingestellte Erkennungssprache.
- Bei schrägen Zeilen richtest du den Scan aus, sofern das Programm eine Funktion zum Geraderichten anbietet, und startest OCR erneut.
- Bei blassen Zeichen ist ein neuer Scan der Originalseite meist zuverlässiger als eine starke nachträgliche Bildkorrektur.
- Bei nur einer fehlerhaften Seite lässt du diese Seite erneut erkennen, statt das komplette Dokument mehrfach umzuwandeln.
- Bei einem bereits stark verkleinerten PDF verwendest du nach Möglichkeit den ursprünglichen Scan. Verlorene Bilddetails lassen sich durch OCR nicht zurückholen.
Handschrift ist für gewöhnliche Dokument-OCR eine besondere Grenze. Einzelne sauber geschriebene Zeichen können erkannt werden, doch eine verlässliche Volltextsuche lässt sich daraus nicht voraussetzen.
Lokale Software oder Online-Texterkennung?
Lokale OCR verarbeitet die Datei auf deinem Gerät und ist für vertrauliche Dokumente meist die passendere Wahl. Ein Onlinedienst erfordert dagegen das Hochladen der PDF-Datei. Bei Verträgen, Ausweiskopien, medizinischen Unterlagen, Personalakten oder internen Geschäftsdokumenten solltest du diesen Übertragungsweg nur nutzen, wenn Datenschutz, Speicherort, Löschregeln und Auftragsverarbeitung für deinen Zweck geklärt sind.
Auch eine Scanner-App auf dem Smartphone kann OCR anbieten. Entscheidend ist, ob sie eine PDF-Datei mit eingebetteter Textebene exportiert oder den erkannten Text nur innerhalb der App anzeigt. Das erkennst du erst zuverlässig am Such- und Kopiertest in einem unabhängigen PDF-Programm.
OCR macht Text auffindbar, aber nicht automatisch korrekt
Eine durchsuchbare Textebene erleichtert das Wiederfinden von Begriffen, ersetzt jedoch keine inhaltliche Prüfung. Besonders bei Aktenzeichen, Rechnungsbeträgen, Kontodaten, Seriennummern und Fristen kann ein einzelnes falsch erkanntes Zeichen relevant sein. Solche Angaben solltest du immer mit dem sichtbaren Scan vergleichen.
Für eine reine Volltextsuche genügt meist ein PDF mit unverändertem Seitenbild und hinterlegter Textebene. Soll der Inhalt anschließend umfassend überarbeitet, barrierefrei strukturiert oder in Word weiterbearbeitet werden, sind zusätzliche Arbeitsschritte nötig. OCR liefert dafür nur den erkannten Text; Überschriftenstruktur, Tabellenlogik, Lesereihenfolge und Formularfunktionen entstehen nicht automatisch.