Beim Kopieren aus PDF fehlen Leerzeichen: Was du dagegen tun kannst

Direkt zur Lösung

Zuletzt geprüft:

Fehlende Leerzeichen beim Kopieren aus einer PDF-Datei entstehen meistens nicht in der Zwischenablage. Häufig enthält die PDF zwar sichtbare Abstände zwischen den Wörtern, aber keine zuverlässig auslesbaren Leerzeichen. Kopiere zuerst denselben kurzen Absatz in einen einfachen Texteditor und anschließend mit einem anderen PDF-Programm. So erkennst du schnell, ob die PDF selbst oder nur das verwendete Programm die Wortabstände falsch verarbeitet.

Der schnellste Test grenzt den Fehler ein

Wähle einen Absatz mit normalen Wörtern, Satzzeichen und mehreren Zeilen. Kopiere ihn zunächst aus dem bisherigen PDF-Programm in einen reinen Texteditor. Unter Windows eignet sich dafür beispielsweise Editor, unter macOS TextEdit im Modus für reinen Text.

  1. Fehlen die Leerzeichen bereits im Texteditor, liegt das Problem wahrscheinlich an der Textstruktur der PDF oder an der Texterkennung.
  2. Sind die Abstände im Texteditor vorhanden, aber in Word, einem E-Mail-Programm oder einem Webformular nicht, verarbeitet das Zielprogramm die Zwischenablage fehlerhaft. Füge den Inhalt dort als unformatierten Text ein.
  3. Kopiert ein anderer PDF-Viewer denselben Absatz richtig, brauchst du die Datei zunächst nicht zu verändern. Nutze für die Übernahme des Textes das funktionierende Programm.
  4. Liefern mehrere Viewer denselben zusammengezogenen Text, muss der Text neu extrahiert, per OCR erkannt oder aus der ursprünglichen Quelldatei neu als PDF erzeugt werden.

Browser zeigen PDF-Dateien zwar bequem an, ihre integrierten Viewer sind aber nicht für jede Schriftkodierung und Textanordnung gleich geeignet. Lade die Datei testweise herunter und öffne sie in einem eigenständigen PDF-Programm. Dieser Vergleich verändert das Dokument nicht und ist daher der sicherste erste Versuch.

Warum sichtbare Wortabstände keine echten Leerzeichen sein müssen

Eine PDF speichert eine Seite nicht zwingend als fortlaufenden Text. Buchstaben und Wortgruppen können stattdessen einzeln an bestimmten Positionen platziert sein. Der sichtbare Abstand entsteht dann durch die Koordinaten der Zeichen. Beim Kopieren muss das Programm aus diesen Positionen ableiten, wo ein Wort endet und ein Leerzeichen einzufügen ist.

Diese Ableitung kann scheitern, wenn Zeichen sehr eng positioniert sind, eine ungewöhnliche Schriftkodierung verwendet wird oder die Zuordnung zwischen dargestellten Zeichen und Textwerten unvollständig ist. Auch ein Export aus einem Layout- oder Druckprogramm kann Text in viele kleine Fragmente zerlegen. Die Seite sieht weiterhin richtig aus, während die ausgelesene Zeichenfolge Wörter zusammenzieht.

Bei einem Scan liegt eine andere Ausgangslage vor: Die Seite besteht zunächst nur aus einem Bild. Kopierbarer Text stammt dann aus einer unsichtbaren OCR-Textebene. Hat die Erkennung Wortgrenzen falsch gesetzt, fehlen die Abstände beim Kopieren, obwohl das Scanbild lesbar aussieht.

Welche Lösung zu deinem Testergebnis passt

Ein anderer PDF-Viewer kopiert den Absatz richtig

In diesem Fall ist die Textinformation grundsätzlich nutzbar. Öffne die vollständige Datei mit dem Viewer, der den Testabsatz richtig übertragen hat, und kopiere den benötigten Inhalt dort. Prüfe nach dem Einfügen besonders Spalten, Zeilenumbrüche, Trennstriche und Fußnoten, weil diese Elemente unabhängig von den Leerzeichen in einer falschen Reihenfolge landen können.

Falls du Adobe Acrobat Reader verwendest, kann auch der umgekehrte Test sinnvoll sein: Öffne die Datei einmal in einem Browser oder in der systemeigenen PDF-Anzeige. Welche Anwendung besser funktioniert, hängt vom Aufbau der einzelnen Datei ab; ein Programm ist nicht bei jeder PDF überlegen.

Die Datei ist ein Scan oder besitzt eine fehlerhafte Textebene

Führe eine neue Texterkennung durch. In Adobe Acrobat ist die entsprechende Funktion im Werkzeugbereich für Scan und OCR zu finden; Bezeichnung und Position können je nach Version und Oberfläche abweichen. Wähle die richtige Dokumentsprache, da sie die Erkennung von Wortgrenzen beeinflusst. Adobe Acrobat Reader allein bietet nicht in jeder Variante den vollständigen OCR-Funktionsumfang.

Nach der Erkennung solltest du nicht sofort das gesamte Dokument übernehmen. Kopiere erneut den Testabsatz und kontrolliere, ob Leerzeichen, Umlaute und Satzzeichen stimmen. Sind die Wortabstände weiterhin falsch, kann eine höhere Scanqualität oder eine erneute OCR mit korrekt gewählter Sprache helfen. Schräg eingescannte, unscharfe oder kontrastarme Seiten benötigen vor der Erkennung häufig eine Bildkorrektur.

Bei vertraulichen Dokumenten ist eine lokale OCR-Anwendung vorzuziehen. Das Hochladen zu einem Online-Dienst kann bedeuten, dass personenbezogene, geschäftliche oder andere sensible Inhalte an einen externen Anbieter übertragen werden.

Die PDF enthält Text, aber alle Programme ziehen Wörter zusammen

Versuche statt des normalen Kopierens einen Export in ein bearbeitbares Format oder in reinen Text. Ein PDF-Programm kann beim Export andere Verfahren zur Worterkennung verwenden als beim Kopieren über die Zwischenablage. Layout, Schriften, Tabellen, Formularfelder und die Lesereihenfolge können sich dabei verändern. Vergleiche das Ergebnis daher mit der sichtbaren PDF.

Hilft auch der Export nicht, ist eine erneute OCR trotz bereits markierbarem Text möglich. Dabei wird die vorhandene, unbrauchbare Textstruktur durch eine neu erkannte Textebene ersetzt oder ergänzt. Arbeite an einer Kopie der Datei, damit das Original erhalten bleibt.

Du hast Zugriff auf das Ursprungsdokument

Der sauberste Weg ist eine neue PDF-Ausgabe aus der ursprünglichen Word-, Office-, Layout- oder Satzdatei. Verwende eine reguläre PDF-Exportfunktion statt eines Umwegs über Bildschirmfoto oder Bilddruck. Schriften sollten eingebettet und Text als Text ausgegeben werden. Bei strukturierten Dokumenten kann eine getaggte PDF außerdem die Lesereihenfolge verbessern.

Teste die neue Datei direkt nach dem Export mit einem Absatz, der verschiedene Wortlängen, Umlaute und Satzzeichen enthält. Funktioniert das Kopieren dort, wurde der Fehler bereits bei der vorherigen PDF-Erstellung eingebaut.

Zusammengezogenen Text nachträglich reparieren

Eine automatische Reparatur ist nur begrenzt zuverlässig. Aus einer Zeichenfolge wie dasisteinbeispiel lässt sich ohne sprachliche Analyse nicht eindeutig bestimmen, an welchen Stellen ursprünglich Leerzeichen standen. Eine globale Ersetzung kann echte Wörter beschädigen oder falsche Abstände erzeugen.

Bei kurzen Passagen ist die manuelle Korrektur meist sicherer. Für längere Texte ist eine erneute OCR oder ein besserer Export sinnvoller als das nachträgliche Erraten sämtlicher Wortgrenzen. Textverarbeitungen mit Rechtschreibprüfung können zusammengezogene Wörter markieren, sie stellen die ursprüngliche Gliederung aber nicht verlässlich wieder her.

Teilautomatische Korrekturen eignen sich nur für klar erkennbare Einzelfälle. Fehlt beispielsweise stets ein Abstand nach einem Satzzeichen, kannst du gezielt nach diesem Muster suchen und die Treffer einzeln bestätigen. Dasselbe gilt für Übergänge zwischen einer Zahl und einer bekannten Einheit. Eine ungeprüfte Ersetzung im gesamten Dokument ist riskant, weil Abkürzungen, Dezimalzahlen und Internetadressen andere Regeln verwenden.

Erfolgskontrolle vor der weiteren Verwendung

Ein fehlerfrei wirkender Testabsatz reicht bei umfangreichen oder mehrspaltigen Dokumenten nicht immer aus. Kontrolliere zusätzlich eine Stelle mit Seitenwechsel, eine Überschrift, einen Absatz mit Trennstrich sowie gegebenenfalls eine Tabelle. Achte dabei auf folgende Punkte:

  • Zwischen allen Wörtern stehen sinnvolle Abstände.
  • Zeilen und Spalten erscheinen in der richtigen Reihenfolge.
  • Wörter am Zeilenende wurden nicht falsch zusammengesetzt oder dauerhaft getrennt.
  • Umlaute, Sonderzeichen und Ligaturen wie fi oder fl bleiben erhalten.
  • Kopfzeilen, Fußzeilen und Seitenzahlen geraten nicht mitten in den Fließtext.

Erst wenn diese Stellen stimmen, eignet sich das Ergebnis für eine längere Übernahme. Bei wichtigen Inhalten sollte der kopierte Text immer mit der sichtbaren PDF verglichen werden.

Häufige Fragen zu fehlerhaften Wortabständen

Kann ein PDF-Passwort fehlende Leerzeichen verursachen?

Ein Passwort oder eine Berechtigungsbeschränkung führt normalerweise nicht nur zum Verlust einzelner Leerzeichen. Ist das Kopieren untersagt, lässt sich Text meist gar nicht oder nur eingeschränkt übernehmen. Entferne keine Zugriffssperre ohne Berechtigung; bitte stattdessen den Dokumentinhaber um eine zugängliche oder exportierbare Fassung.

Verbessert eine barrierefreie PDF das Kopierergebnis?

Eine sauber strukturierte, getaggte PDF kann Lesereihenfolge und Textausgabe verbessern. Tags allein garantieren jedoch keine richtigen Wortabstände. Schriftkodierung, Zeichenpositionen und die tatsächliche Textschicht müssen ebenfalls korrekt angelegt sein.

Warum fehlen Leerzeichen nur in einer Spalte oder Überschrift?

Einzelne Bereiche können mit einer anderen Schrift, engerer Zeichenpositionierung oder einer separaten Textstruktur erzeugt worden sein. Betrifft der Fehler nur solche Elemente, exportiere oder erkenne möglichst die betreffende Seite neu. Eine vollständige OCR des gesamten Dokuments ist dann nicht zwingend erforderlich.

Schreibe einen Kommentar