So korrigieren Sie Text, der aus einer PDF-Datei kopiert wurde (Zeilenumbrüche und Abstände)
Sie kopieren ein paar Absätze aus einer PDF-Datei, fügen sie in ein Dokument ein, und der Text ist ein Durcheinander, jede Zeile endet abrupt, Sätze werden in Fragmente zerhackt und überall sind Leerzeilen. Dies ist eines der häufigsten und lästigsten Textprobleme und tritt aus einem bestimmten Grund auf. Sobald Sie verstehen, warum, dauert die Behebung des Problems nur wenige Sekunden.
Warum PDF-Text so abbricht
PDFs speichern Text anhand seiner visuellen Position auf der Seite und nicht als fließenden Satzstrom. Jede Zeile, die Sie sehen, ist an bestimmten Koordinaten platziert, und das PDF „weiß“ nicht wirklich, dass eine Zeile als Satz in die nächste übergeht. Wenn Sie also kopieren, fügt die Extraktion am Ende jeder sichtbaren Zeile einen Zeilenumbruch ein, da für die Datei jede Zeile ein separat platziertes Objekt ist. Das Ergebnis ist, dass der Text nicht in jedem Absatz, sondern in jeder Zeile unterbrochen wird, oft mit zusätzlichen Leerzeilen dazwischen. Es ist nicht Ihre Schuld oder die der Kopierfunktion; Auf diese Weise stellen PDFs Text dar.
Was „reparieren“ eigentlich bedeutet
Das Korrigieren von PDF-kopiertem Text bedeutet, die unterbrochenen Zeilen wieder zu richtigen Absätzen zusammenzufügen. Es gibt jedoch eine Feinheit: Sie möchten die Zeilen innerhalb eines Absatzes verbinden und gleichzeitig die Pausen zwischen den Absätzen beibehalten. Das naive Entfernen jedes Zeilenumbruchs würde das gesamte Dokument zu einem riesigen Block ohne jegliche Absatzstruktur zusammenfügen, was noch schlimmer ist. Die gute Lösung unterscheidet einen Zeilenumbruch innerhalb eines Absatzes (der zu einem Leerzeichen werden sollte) von der Leerzeile zwischen Absätzen (die bleiben sollte). Das ist es, was gebrochenen Text wieder in lesbare Prosa verwandelt.
Die Werkzeuge für den Job
Zwei verwandte Bereinigungen erledigen das. Durch das Entfernen von Zeilenumbrüchen werden die fragmentierten Zeilen wieder zusammengefügt. Der beste Modus besteht darin, Zeilenumbrüche durch Leerzeichen innerhalb von Absätzen zu ersetzen und gleichzeitig die Leerzeilen, die Absätze trennen, beizubehalten, sodass Sie fließenden Text mit intakter Struktur erhalten. Durch das Entfernen leerer Zeilen werden dann alle verbleibenden Leerzeilen aus der eingefügten PDF-Datei gelöscht. Führen Sie sie in dieser Reihenfolge aus, und aus unordentlichem PDF-Text werden saubere, lesbare Absätze, die Sie tatsächlich verwenden können.
Andere Quellen mit dem gleichen Problem
PDFs sind der schlimmste Übeltäter, aber das gleiche Problem mit unterbrochenen Linien tritt auch anderswo auf. Text, der aus E-Mails kopiert wird, insbesondere aus weitergeleiteten, kommt häufig mit harten Zeilenumbrüchen und fester Breite an. Einige Webseiten und Codekommentare umschließen den Text mit echten Zeilenumbrüchen. Text aus älteren Dokumenten und Terminalausgaben können dasselbe bewirken. Die Lösung ist in allen Fällen identisch: Die Zeilen innerhalb der Absätze wieder zusammenfügen, die Absatzumbrüche beibehalten und die Leerstellen löschen. Sobald Sie das Muster erkennen, werden Sie es reflexartig beheben.
Ein Klartext-Workflow
Bei völlig unordentlichem eingefügtem Text erledigt eine dreistufige Bereinigung fast alles: Entfernen Sie die zusätzlichen Zeilenumbrüche, um Absätze wieder zusammenzufügen, entfernen Sie leere Zeilen, um die Lücken zu schließen, und entfernen Sie zusätzliche Leerzeichen, um doppelte oder vereinzelte Leerzeichen zu normalisieren, die die Quelle hinterlassen hat. Da diese Tools alle im Browser ausgeführt werden, können Sie ein vertrauliches Dokument bereinigen, ohne dass etwas davon hochgeladen werden muss. Das Ergebnis ist ein Text, der so aussieht und sich so verhält, als ob er überhaupt sauber eingegeben worden wäre.