Hilfe suchen

Konkrete PDF-Hilfe

Mehrseitiger Scan wird in einzelne Dateien zerlegt: So kannst Du OCR-Ergebnis schnell auf typische Fehler prüfen

Bei einem mehrseitigen Scan solltest Du zuerst klären, ob bereits jede Seite als eigene PDF vorliegt oder ob das Dokument noch aufgeteilt werden muss. Prüfe danach nicht den …

Von der PDF-Tipps-Redaktion · Aktualisiert am 1. Oktober 2026 · 6 Min. Lesezeit

Startseite / Mehrseitiger Scan wird in einzelne Dateien zerlegt: So kannst Du OCR-Ergebnis schnell auf typische Fehler prüfen

Mit dem schnellsten Gegencheck beginnenOriginaldatei unverändert aufbewahrenErgebnis nach jedem Schritt prüfen

Bei einem mehrseitigen Scan solltest Du zuerst klären, ob bereits jede Seite als eigene PDF vorliegt oder ob das Dokument noch aufgeteilt werden muss. Prüfe danach nicht den gesamten erkannten Text Wort für Wort, sondern beginne mit Seitenzuordnung, Suchtest und gezielten Stichproben an fehleranfälligen Stellen. So findest Du schnell heraus, ob nur einzelne Zeichen falsch erkannt wurden oder ob Seiten fehlen, vertauscht sind oder gar keine nutzbare Textebene besitzen.

Erst Seitenstruktur sichern, dann Einzeldateien erzeugen

Lege vor dem Zerlegen eine unveränderte Kopie der ursprünglichen Scan-PDF ab. Sie dient als Rückweg, falls Seiten beim Export falsch sortiert, gedreht oder ausgelassen werden. Kontrolliere in der Miniaturansicht außerdem die Gesamtzahl und Reihenfolge der Seiten.

Verwende in Deinem PDF-Programm eine Funktion wie Teilen, Seiten extrahieren oder Seiten organisieren. Die Bezeichnungen unterscheiden sich je nach Programm und Version. Soll jede Seite eine eigene Datei werden, wählst Du als Trennregel jeweils eine Seite pro Dokument. Eine Funktion zum Löschen von Seiten ist dafür ungeeignet, weil sie keine verlässliche Serie von Einzeldateien erzeugt.

  1. Speichere die Originaldatei unverändert in einem eigenen Ordner.
  2. Notiere die erwartete Seitenzahl und prüfe die sichtbare Reihenfolge.
  3. Exportiere jede Seite als separate PDF-Datei.
  4. Vergib Dateinamen mit führenden Nullen, etwa Scan_001.pdf, Scan_002.pdf und Scan_003.pdf. Dadurch bleibt die Sortierung auch bei vielen Seiten erhalten.
  5. Vergleiche die Zahl der erzeugten Dateien mit der Seitenzahl des Originals.
  6. Öffne die erste, eine mittlere und die letzte Einzeldatei, um Zuordnung und Lesbarkeit zu kontrollieren.

Enthält die ursprüngliche PDF bereits eine OCR-Textebene, bleibt sie beim verlustfreien Extrahieren von Seiten normalerweise erhalten. Wird jede Seite stattdessen erneut als Bild gedruckt oder exportiert, kann diese Textebene verloren gehen. Ein anschließender Suchtest zeigt sofort, ob der Text noch vorhanden ist.

OCR vor oder nach dem Aufteilen ausführen?

Bei einem gleichmäßig gescannten Dokument ist es meist übersichtlicher, die Texterkennung auf die vollständige PDF anzuwenden und die Seiten danach zu extrahieren. Einheitliche Spracheinstellungen und eine zusammenhängende Kontrolle lassen sich so leichter handhaben. Die Einzeldateien müssen anschließend trotzdem stichprobenartig geprüft werden, weil der Seitenexport die Zuordnung verändern kann.

Microsoft Edge speichert PDFs statt sie zu öffnen: So kannst Du Vorschau und Suchindex reparierenPassende Anleitung öffnen →
Microsoft Edge speichert PDFs statt sie zu öffnen: So kannst Du Vorschau und Suchindex reparieren
Adobe Reader verlangt ständig eine Anmeldung: Ursache finden, Installation reparieren und Einstellungen zurücksetzenPassende Anleitung öffnen →
Adobe Reader verlangt ständig eine Anmeldung: Ursache finden, Installation reparieren und Einstellungen zurücksetzen

Die Erkennung nach dem Aufteilen ist sinnvoll, wenn nur wenige Seiten problematisch sind oder verschiedene Dokumentteile unterschiedliche Sprachen, Ausrichtungen oder Scanqualitäten haben. Dann kannst Du fehlerhafte Seiten erneut erkennen lassen, ohne das gesamte Dokument zu verarbeiten.

Vermeide bei vertraulichen Unterlagen einen ungeprüften Upload zu einem Online-Dienst. Lokale PDF- oder OCR-Programme halten die Dateien auf dem eigenen Gerät. Falls ein Onlinedienst unvermeidbar ist, solltest Du vorab klären, wie er Uploads speichert, verarbeitet und löscht.

Der schnelle Prüfpfad für jede Dateiserie

Eine gute Schnellkontrolle trennt strukturelle Fehler von Erkennungsfehlern. Arbeite in dieser Reihenfolge, damit Du nicht Zeit in die Textprüfung einer falsch zugeordneten oder leeren Seite investierst.

  1. Dateien zählen: Die Anzahl der Einzel-PDFs muss der Seitenzahl des Ausgangsdokuments entsprechen. Bei einer Abweichung wiederholst Du zuerst die Aufteilung.
  2. Reihenfolge prüfen: Vergleiche Seitenzahlen, Überschriften oder fortlaufende Absätze zwischen Original und Einzeldateien. Stimmen sie nicht überein, korrigiere Benennung oder Exportreihenfolge vor der OCR-Kontrolle.
  3. Nach einem sichtbaren Wort suchen: Wähle ein längeres, eindeutig lesbares Wort aus der Seite. Wird es gefunden und markiert, ist grundsätzlich eine durchsuchbare Textebene vorhanden.
  4. Eine Textstelle kopieren: Kopiere zwei oder drei Zeilen in einen einfachen Texteditor. So werden unsichtbare Zeichenfehler, eine falsche Lesereihenfolge und unerwartete Zeilenumbrüche sichtbar.
  5. Fehlerzonen ansehen: Kontrolliere kleine Schrift, Zahlenfolgen, Sonderzeichen, Seitenränder und schräg gescannte Bereiche. Dort treten Erkennungsfehler häufiger auf als in großen, klaren Fließtextzeilen.

Wenn sich Text markieren lässt, die Suche aber ein gut lesbares Wort nicht findet, kann die OCR dieses Wort falsch erkannt haben. Wenn sich überhaupt nichts markieren oder durchsuchen lässt, besteht die Seite möglicherweise nur aus einem Bild oder die Textebene wurde beim Export entfernt. Bei einer Markierung an der falschen Position liegt eher ein Problem mit der unsichtbaren Textschicht als mit dem sichtbaren Scanbild vor.

Diese OCR-Fehler liefern die aussagekräftigsten Stichproben

Für eine schnelle Qualitätsbewertung reichen wenige sorgfältig ausgewählte Stellen. Kontrolliere dabei nicht nur normale Wörter, sondern Zeichenfolgen, an denen OCR-Systeme leicht scheitern.

  • Ähnliche Zeichen: Prüfe Kombinationen wie O und 0, I und l sowie rn und m. Besonders relevant sind Aktenzeichen, Rechnungsnummern, Namen und Datumsangaben.
  • Umlaute und ß: Suche nach Wörtern mit ä, ö, ü oder ß. Flecken, geringe Auflösung und ungeeignete Spracheinstellungen können diese Zeichen verfälschen.
  • Silbentrennungen: Kopiere einen Absatz über einen Zeilenwechsel hinweg. Ein am Zeilenende getrenntes Wort kann mit Bindestrich übernommen, falsch zusammengesetzt oder in zwei Suchbegriffe zerlegt worden sein.
  • Spalten und Textkästen: Kopiere mehrere Zeilen aus mehrspaltigen Seiten. Springt der Text zwischen Spalten oder Abschnitten hin und her, ist die Lesereihenfolge fehlerhaft, obwohl jedes einzelne Wort richtig aussehen kann.
  • Kopf- und Fußzeilen: Wiederkehrende Seitenzahlen oder Überschriften können mitten in den kopierten Fließtext geraten. Für reine Volltextsuche ist das oft hinnehmbar, für eine Weiterverarbeitung jedoch störend.
  • Leere oder bildlastige Seiten: Seiten mit Stempeln, handschriftlichen Vermerken oder sehr wenig Maschinenschrift können trotz OCR kaum durchsuchbaren Text enthalten. Handschrift wird von einer normalen Druckschrift-OCR nicht zuverlässig erfasst.

Stichprobe passend zum Verwendungszweck wählen

Die notwendige Prüftiefe hängt davon ab, was mit den Einzeldateien geschehen soll. Für eine grobe Volltextsuche genügt oft, wenn typische Begriffe gefunden werden und jede Seite eine plausible Textebene besitzt. Sollen Namen, Beträge, Fristen oder Identifikationsnummern übernommen werden, müssen diese Angaben direkt mit dem sichtbaren Scanbild verglichen werden.

Bei einer längeren Dateiserie prüfst Du mindestens den Anfang, die Mitte und das Ende sowie jede sichtbar auffällige Seite. Ergänze Seiten mit kleiner Schrift, schiefem Einzug, Stempel, Spalten oder schwachem Kontrast. Findest Du in dieser Auswahl denselben Fehlertyp mehrfach, behandle ihn nicht als Einzelfall: Erweitere die Kontrolle auf alle Seiten mit vergleichbarem Layout.

Aus dem Prüfergebnis den nächsten Schritt ableiten

Einzelne falsche Buchstaben bei ansonsten guter Suche sprechen für lokale OCR-Fehler. Korrigiere sie nur dann manuell, wenn Dein Programm die Bearbeitung der Textebene unterstützt und die betroffenen Angaben wichtig sind. Andernfalls kann eine erneute Erkennung der betreffenden Seite mit passender Dokumentsprache und korrekt ausgerichtetem Scan die bessere Lösung sein.

Sind viele Wörter derselben Seite unbrauchbar, kontrolliere zunächst das sichtbare Bild. Unscharfe, stark geneigte, abgeschnittene oder kontrastarme Vorlagen benötigen eher einen besseren Scan als einen weiteren Durchlauf mit unveränderten Einstellungen. Ist das Bild sauber, prüfe Sprache, Seitenausrichtung und Erkennungsmodus des verwendeten OCR-Programms.

Fehlt nur in einzelnen Dateien die Textebene, wurden diese Seiten möglicherweise anders exportiert oder von der Erkennung ausgelassen. Wiederhole die OCR gezielt für diese Dateien. Fehlt sie in der gesamten Serie, prüfe, ob beim Zerlegen ein Bildexport oder ein virtueller PDF-Drucker verwendet wurde. Extrahiere die Seiten nach Möglichkeit direkt aus der durchsuchbaren Original-PDF, statt sie neu zu drucken.

Die Prüfung ist abgeschlossen, wenn Dateizahl und Reihenfolge stimmen, ausgewählte Begriffe gefunden werden, kopierte Textstellen in sinnvoller Reihenfolge erscheinen und wichtige Zahlen oder Namen mit dem sichtbaren Scan übereinstimmen. Bewahre die ursprüngliche mehrseitige PDF mindestens so lange auf, bis alle Einzeldateien diese Kontrolle bestanden haben.

Sinnvolle nächste Wege

Wenn Dein Fall etwas anders aussieht

Die folgenden Anleitungen behandeln ähnliche Symptome, aber andere Ursachen oder Programme. Vergleiche die Kurzbeschreibung mit Deiner Situation.

Noch nicht gelöst?

Beschreibe, was genau nicht funktioniert

Ein kurzer Satz mit Fehlermeldung, Programm und Gerät führt meist schneller zur passenden Anleitung als ein allgemeiner Suchbegriff.