如何修复从 PDF 复制的文本(换行符和间距)
你从 PDF 中复制几个段落,将它们粘贴到文档中,文本一片混乱,每一行都突然结束,句子被切成碎片,到处都是空行。这是最常见、最烦人的文本问题之一,它的发生是有特定原因的。一旦了解了原因,修复它只需几秒钟。
为什么PDF文本会这样断掉
PDF 根据文本在页面上的视觉位置来存储文本,而不是作为流动的句子流。您看到的每一行都放置在特定的坐标处,并且 PDF 并不真正“知道”一行作为句子延续到下一行。因此,当您复制时,提取会在每个可视行的末尾插入一个换行符,因为就文件而言,每一行都是一个单独的放置对象。结果是文本在每一行而不是在每个段落都被破坏,并且文本之间通常有额外的空行。这不是你的错,也不是复制功能的错;这就是 PDF 表示文本的方式。
“修复”实际上意味着什么
修复 PDF 复制的文本意味着将断线重新连接到正确的段落中。但有一个微妙之处:您想要连接段落内的行,同时保留段落之间的分隔符。天真地删除每个换行符会将整个文档合并成一个巨大的块,根本没有段落结构,这更糟糕。好的修复方法将段落内的换行符(应成为空格)与段落之间的空行(应保留)区分开来。这就是将破碎的文本重新变成可读的散文的原因。
工作所需的工具
两个相关的清理处理它。删除换行符会重新连接零散的行,最好的模式是用段落内的空格替换换行符,同时保留分隔段落的空行,这样您就可以获得结构完整的流畅文本。然后删除空行会清除 PDF 插入的所有剩余空白行。按该顺序运行它们,杂乱的 PDF 文本就会变成干净、可读的段落,您可以实际使用。
其他有同样问题的来源
PDF 是最严重的问题,但同样的断线问题也出现在其他地方。从电子邮件复制的文本,尤其是转发的文本,通常会以固定宽度进行硬换行。一些网页和代码注释用真正的换行符包裹文本。来自旧文档和终端输出的文本也可以执行相同的操作。在每种情况下,修复方法都是相同的:重新连接段落内的行,保留段落分隔符,并清除空白。一旦你认识到了这个模式,你就会本能地修复它。
干净的文本工作流程
对于完全混乱的粘贴文本,三步清理几乎可以处理任何事情:删除额外的换行符以重新连接段落,删除空行以清除间隙,并删除额外的空格以规范源留下的任何重复或杂散的空白。由于这些工具都在浏览器中运行,因此您可以在不上传任何机密文档的情况下清理机密文档。结果是文本的外观和行为就像一开始就干净地键入一样。