Hilfe suchen

Konkrete PDF-Hilfe

Warum OCR Spalten unleserlich macht – Sprache und Erkennungsqualität richtig einstellen

Bei mehrspaltigen PDF-Seiten scheitert meist nicht die Zeichenerkennung selbst, sondern die Ermittlung der Lesereihenfolge. Die OCR erkennt einzelne Wörter möglicherweise richtig, verbindet aber Zeilen aus der linken und …

Von der PDF-Tipps-Redaktion · Aktualisiert am 3. Oktober 2026 · 6 Min. Lesezeit

Startseite / Warum OCR Spalten unleserlich macht – Sprache und Erkennungsqualität richtig einstellen

Mit dem schnellsten Gegencheck beginnenOriginaldatei unverändert aufbewahrenErgebnis nach jedem Schritt prüfen

Bei mehrspaltigen PDF-Seiten scheitert meist nicht die Zeichenerkennung selbst, sondern die Ermittlung der Lesereihenfolge. Die OCR erkennt einzelne Wörter möglicherweise richtig, verbindet aber Zeilen aus der linken und rechten Spalte zu einem unbrauchbaren Textstrom. Stelle zuerst die Dokumentensprache passend ein, prüfe Ausrichtung und Scanqualität und kontrolliere danach, ob das Programm getrennte Textblöcke statt einer einzigen Seitenbreite erkennt.

Warum zwei saubere Spalten nach der OCR vermischt werden

Eine OCR verarbeitet eine Seite in mehreren Schritten. Sie sucht zunächst nach Bildbereichen, Textzeilen und Zeichen. Danach muss sie entscheiden, welche Textblöcke zusammengehören und in welcher Reihenfolge sie gelesen werden. Gerade dieser zweite Teil ist bei Zeitungsseiten, wissenschaftlichen Artikeln, Geschäftsberichten oder Broschüren anspruchsvoll.

Schmale Zwischenräume, Trennlinien oder deutlich voneinander abgegrenzte Textblöcke erleichtern die Layoutanalyse. Ist der Spaltenabstand gering, verläuft eine Überschrift über mehrere Spalten oder ragt eine Abbildung in den Text, kann das Programm zwei Zeilen auf gleicher Höhe als zusammengehörig behandeln. Beim Kopieren entsteht dann beispielsweise eine Folge aus linker Zeile, rechter Zeile, nächster linker Zeile und nächster rechter Zeile.

Auch eine leicht gedrehte Seite verschärft das Problem. Die Zeilen liegen dann nicht mehr exakt waagerecht, wodurch Abstände und Blockgrenzen schwerer zu bestimmen sind. Flecken, durchscheinende Rückseiten, dunkle Ränder und starke Kompressionsartefakte können vermeintliche Verbindungen zwischen eigentlich getrennten Bereichen erzeugen.

Erst feststellen, welche Erkennungsstufe fehlschlägt

Eine kurze Gegenprobe verhindert, dass Du nur an der Spracheinstellung arbeitest, obwohl die Seitenstruktur das eigentliche Problem ist:

Offline-Zugriff in Google Drive funktioniert nicht: Die nächsten Schritte für PDFsPassende Anleitung öffnen →
Offline-Zugriff in Google Drive funktioniert nicht: Die nächsten Schritte für PDFs
PDF auf dem iPad nicht ausfüllbar? Ursachen prüfen und große Dokumente versendenPassende Anleitung öffnen →
PDF auf dem iPad nicht ausfüllbar? Ursachen prüfen und große Dokumente versenden
  1. Vergrößere die PDF-Seite und prüfe das sichtbare Scanbild. Sind Buchstaben scharf, Zeilen gerade und die Zwischenräume der Spalten klar erkennbar, bietet die Bildvorlage eine brauchbare Ausgangslage.
  2. Markiere innerhalb einer einzigen Spalte zwei oder drei Zeilen und kopiere sie in einen einfachen Texteditor. Bleiben Wörter und Sonderzeichen richtig, aber die Reihenfolge springt zwischen den Spalten, liegt der Fehler überwiegend in der Layout- oder Lesereihenfolge.
  3. Enthält bereits eine einzelne Zeile viele falsche Buchstaben, betrifft das Problem die Zeichenerkennung. Dann sind Sprache, Auflösung, Kontrast oder Schriftbild wichtiger als die Spaltentrennung.
  4. Ist die Auswahl im PDF optisch rechteckig, der eingefügte Text aber vermischt, kann zusätzlich die unsichtbare Textebene falsch aufgebaut sein. Das sichtbare Seitenbild allein belegt keine korrekte OCR-Struktur.

Diese Unterscheidung ist wichtig: Eine höhere Erkennungsqualität kann falsche Zeichen reduzieren, repariert jedoch nicht zwangsläufig eine fehlerhafte Lesereihenfolge.

Sprache passend zum Inhalt statt zur Programmoberfläche wählen

Die OCR-Sprache muss der Sprache des Dokuments entsprechen, nicht der Sprache von Windows, macOS oder der Anwendung. Für einen deutschen Geschäftsbericht wählst Du Deutsch, auch wenn das OCR-Programm auf Englisch bedient wird. Das Sprachmodell hilft bei der Unterscheidung ähnlich aussehender Zeichen und bei der Bewertung wahrscheinlicher Wortfolgen.

  • Wähle eine einzelne Hauptsprache, wenn fast der gesamte Fließtext in dieser Sprache verfasst ist.
  • Aktiviere mehrere Sprachen nur bei tatsächlich gemischten Seiten. Eine unnötig große Sprachauswahl kann mehr Zeichenvarianten zulassen und dadurch die Eindeutigkeit verringern.
  • Bei deutschen Texten sollte Deutsch aktiviert sein, damit Umlaute, ß und typische Wortformen berücksichtigt werden.
  • Eigennamen, Produktcodes, Formeln und Abkürzungen können trotz richtiger Sprache falsch erkannt werden, weil sie nicht dem normalen Wortschatz folgen.

Die Spracheinstellung verbessert vor allem Wörter und Zeichen. Vermischt die OCR zwei Spalten trotz weitgehend richtiger Buchstaben, musst Du zusätzlich die Seitenanalyse oder den Erkennungsbereich beeinflussen.

Die Bildvorlage für die Spaltenerkennung vorbereiten

Vor einer erneuten Texterkennung sollte die Seite gerade ausgerichtet und auf den tatsächlichen Inhalt zugeschnitten sein. Große schwarze Scanränder, Schatten am Buchfalz oder mitgescannte Nachbarseiten können die automatische Blockerkennung irritieren.

Wähle für die Erkennung die unverfälschte oder möglichst wenig komprimierte Ausgangsdatei. Ein zuvor stark verkleinertes PDF enthält oft ausgefranste Buchstabenkanten und blockartige Artefakte. Eine nachträgliche Erhöhung der Bildauflösung erzeugt keine verlorenen Details neu. Besser ist ein erneuter Scan aus der ursprünglichen Vorlage, sofern sie verfügbar ist.

Als Erfolgskriterium sollte nicht nur die schärfere Bildschirmansicht dienen. Prüfe nach jeder Änderung dieselbe problematische Passage: Lässt sich eine komplette linke Spalte von oben nach unten kopieren, bevor der Text in die rechte Spalte wechselt? Diese Prüfung zeigt direkt, ob die Layoutanalyse besser geworden ist.

Automatische Layoutanalyse oder getrennte Bereiche verwenden

Viele OCR-Anwendungen bieten eine automatische Seitenerkennung; Bezeichnungen und Umfang unterscheiden sich je nach Programmversion. Suche in den Erkennungsoptionen nach Einstellungen für Seitenlayout, Textbereiche, Dokumenttyp oder Lesereihenfolge. In Adobe Acrobat liegt die Texterkennung im Werkzeugbereich für Scan und OCR; die verfügbaren Einstellungen hängen von Ausgabe und Version ab.

Für eine normale Seite mit zwei gleich breiten Spalten ist die automatische Layoutanalyse der erste Versuch. Erkennt sie die Grenze wiederholt falsch, sind manuell getrennte Erkennungsbereiche die verlässlichere Methode, sofern das verwendete Programm diese Bearbeitung unterstützt. Dabei erhält jede Spalte einen eigenen Textbereich. Überschriften über der gesamten Seitenbreite und Fußnoten werden als separate Bereiche behandelt.

Unterstützt die Anwendung keine Bereichskorrektur, kannst Du mit einer Arbeitskopie zwei Ausschnitte erzeugen: einmal nur die linke und einmal nur die rechte Spalte. Führe die OCR für beide Ausschnitte getrennt aus und setze den Text in der gewünschten Reihenfolge zusammen. Dieser Weg ist umständlicher, trennt aber Zeichenerkennung und Lesereihenfolge eindeutig. Bewahre das unveränderte Original auf, damit beim Zuschneiden keine Inhalte verloren gehen.

Erkennungsqualität und Ausgabeart sinnvoll wählen

Optionen wie hohe Genauigkeit, gründliche Erkennung oder präziser Modus verwenden üblicherweise mehr Analyseaufwand als schnelle Modi. Welche Berechnung dahintersteht, ist programmspezifisch. Nutze die höhere Qualitätsstufe für dicht gesetzte Spalten, kleine Schrift oder unruhige Vorlagen und bewerte das Ergebnis anhand derselben Testpassage.

Auch die Ausgabeart verändert das Resultat. Ein durchsuchbares PDF behält häufig das Seitenbild und legt eine unsichtbare Textebene darüber. Das Erscheinungsbild bleibt nahe am Scan, doch eine falsche Lesereihenfolge kann beim Kopieren oder Vorlesen verborgen bleiben. Eine Ausgabe als bearbeitbarer Text versucht dagegen, Absätze und Textblöcke sichtbar nachzubilden. Dadurch fallen Strukturfehler früher auf, das ursprüngliche Layout kann sich jedoch stärker verändern.

  • Benötigst Du vor allem Suche und originalgetreue Ansicht, ist eine durchsuchbare Textebene meist passend.
  • Willst Du den Inhalt weiterbearbeiten, exportiere in ein bearbeitbares Format und kontrolliere Spaltenwechsel, Überschriften und Fußnoten einzeln.
  • Soll ein Screenreader das Dokument nutzen, reicht korrekter Zeichentext nicht aus. Die logische Lesereihenfolge und Dokumentstruktur müssen ebenfalls geprüft und gegebenenfalls nachbearbeitet werden.

Eine belastbare Reihenfolge für den zweiten OCR-Durchlauf

  1. Arbeite mit einer Kopie des bestmöglichen Ausgangsscans.
  2. Richte schiefe Seiten gerade aus und entferne ausschließlich störende Außenränder, ohne Text anzuschneiden.
  3. Stelle die tatsächliche Hauptsprache des Dokuments ein und beschränke zusätzliche Sprachen auf notwendige Fälle.
  4. Aktiviere die Layout- oder Seitenanalyse und wähle bei schwierigen Vorlagen eine höhere Qualitätsstufe.
  5. Erkenne zunächst nur eine typische Problemseite statt sofort das gesamte Dokument.
  6. Kopiere mehrere zusammenhängende Zeilen aus jeder Spalte in einen Texteditor und prüfe Zeichen sowie Reihenfolge getrennt.
  7. Bleiben die Zeichen richtig, während die Spalten springen, korrigiere die Textbereiche beziehungsweise Lesereihenfolge oder verarbeite die Spalten getrennt.
  8. Erst nach einem erfolgreichen Test lässt Du alle Seiten erneut erkennen.

Damit vermeidest Du lange OCR-Durchläufe mit unveränderten Fehlern. Bei wechselnden Seitenlayouts können mehrere Profile nötig sein: etwa eines für zweispaltige Hauptseiten und ein weiteres für ganzseitige Übersichten.

Wo automatische OCR an ihre Grenze kommt

Automatische Verfahren bleiben anfällig, wenn Text um Bilder fließt, Randnotizen zwischen Spalten stehen, Überschriften mehrere Bereiche verbinden oder jede Seite anders aufgebaut ist. Ebenso schwierig sind historische Drucke, sehr kleine Schriften und Vorlagen mit starkem Durchscheinen.

In solchen Fällen ist Nachbearbeitung kein Zeichen einer falschen Grundeinstellung. Die Software muss aus geometrischen Hinweisen eine Leselogik ableiten, die im Seitenbild nicht ausdrücklich gespeichert ist. Für wenige Seiten lohnt sich die manuelle Bereichs- und Reihenfolgekorrektur. Bei umfangreichen Dokumenten solltest Du zuerst repräsentative Seitentypen testen und erst danach entscheiden, ob getrennte Erkennungsläufe oder eine Anwendung mit bearbeitbaren Textzonen erforderlich sind.

Sinnvolle nächste Wege

Wenn Dein Fall etwas anders aussieht

Die folgenden Anleitungen behandeln ähnliche Symptome, aber andere Ursachen oder Programme. Vergleiche die Kurzbeschreibung mit Deiner Situation.

Mehrseitiger Scan wird in einzelne Dateien zerlegt: So kannst Du OCR-Ergebnis schnell auf typische Fehler prüfen

Bei einem mehrseitigen Scan solltest Du zuerst klären, ob bereits jede Seite als eigene PDF vorliegt oder ob das Dokument noch aufgeteilt werden muss. Prüfe danach nicht den gesamten erkannten Text Wort für Wort, …

Anleitung öffnen →

PDF automatisch auslesen: Welche OCR- und KI-Lösungen gibt es?

Für das automatische Auslesen von PDF-Dateien kommen drei Lösungsklassen infrage: klassische OCR für gescannte Seiten, PDF-Extraktion für bereits vorhandenen Text und KI-gestützte Dokumentenerkennung für Felder, Tabellen und Dokumenttypen. Der erste Test sollte deshalb klären, …

Anleitung öffnen →

Zeugnis Scan ist bei Bewerbungsunterlagen als PDF zu dunkel

Ein zu dunkel gescanntes Zeugnis sollte möglichst aus der Originalvorlage neu erstellt werden. Prüfe zuerst, ob wirklich die PDF-Datei dunkel ist oder nur das verwendete Anzeigeprogramm: Öffne sie in einem zweiten PDF-Reader und drucke …

Anleitung öffnen →

PDF/A wird verlangt: So erstellst und prüfst du das richtige Format

Für eine akzeptierte PDF/A-Datei musst du zuerst die verlangte Variante klären, das Dokument mit einem passenden PDF/A-Profil exportieren und das Ergebnis anschließend validieren. Eine Datei ist nicht schon deshalb normgerecht, weil ihr Name auf …

Anleitung öffnen →

PDF-Seite einfügen, ohne das gesamte Dokument neu zu erstellen

Eine einzelne Seite lässt sich direkt in eine bestehende PDF-Datei einsetzen. Du brauchst dafür ein Programm, das Seiten verwalten oder PDF-Dateien zusammenführen kann; ein reiner PDF-Reader genügt meist nicht. Erstelle zuerst eine Sicherungskopie und …

Anleitung öffnen →

Noch nicht gelöst?

Beschreibe, was genau nicht funktioniert

Ein kurzer Satz mit Fehlermeldung, Programm und Gerät führt meist schneller zur passenden Anleitung als ein allgemeiner Suchbegriff.