Como corrigir texto copiado de um PDF (quebras de linha e espaçamento)
Você copia alguns parágrafos de um PDF, cola-os em um documento e o texto fica uma bagunça, cada linha termina abruptamente, as frases são cortadas em fragmentos e há linhas em branco por toda parte. Este é um dos problemas de texto mais comuns e irritantes e acontece por um motivo específico. Depois de entender o porquê, consertar isso leva segundos.
Por que o texto do PDF quebra assim
Os PDFs armazenam texto por sua posição visual na página, não como um fluxo contínuo de frases. Cada linha que você vê é colocada em coordenadas específicas, e o PDF realmente não "sabe" que uma linha continua na próxima como uma frase. Assim, quando você copia, a extração insere uma quebra de linha no final de cada linha visual, porque no que diz respeito ao arquivo, cada linha é um objeto colocado separado. O resultado é texto quebrado em cada linha e não em cada parágrafo, muitas vezes com linhas extras em branco entre eles. A culpa não é sua nem da função de cópia; é como os PDFs representam o texto.
O que 'consertar' isso realmente significa
Corrigir texto copiado em PDF significa reunir as linhas quebradas em parágrafos adequados. Mas há uma sutileza: você deseja unir as linhas de um parágrafo, mantendo as quebras entre os parágrafos. Remover ingenuamente cada quebra de linha fundiria todo o documento em um bloco gigante sem nenhuma estrutura de parágrafo, o que é pior. A boa solução distingue uma quebra de linha dentro de um parágrafo (que deve se tornar um espaço) da linha em branco entre os parágrafos (que deve permanecer). É isso que transforma o texto quebrado novamente em prosa legível.
As ferramentas para o trabalho
Duas limpezas relacionadas cuidam disso. A remoção de quebras de linha reúne novamente as linhas fragmentadas, o melhor modo é aquele que substitui as quebras de linha por espaços dentro dos parágrafos, preservando as linhas em branco que separam os parágrafos, para que você obtenha um texto fluido com sua estrutura intacta. Em seguida, a remoção de linhas vazias limpa quaisquer linhas em branco restantes que o PDF inseriu. Execute-os nessa ordem e o texto bagunçado do PDF se tornará parágrafos limpos e legíveis que você pode realmente usar.
Outras fontes com o mesmo problema
Os PDFs são os piores criminosos, mas o mesmo problema de linha quebrada aparece em outros lugares. O texto copiado de e-mails, especialmente os encaminhados, geralmente chega com quebras de linha rígidas em larguras fixas. Algumas páginas da web e comentários de código envolvem o texto com quebras de linha reais. O texto de documentos mais antigos e a saída do terminal podem fazer o mesmo. A correção é idêntica em todos os casos: junte novamente as linhas dos parágrafos, mantenha as quebras de parágrafo e limpe os espaços vazios. Depois de reconhecer o padrão, você o corrigirá reflexivamente.
Um fluxo de trabalho de texto limpo
Para texto colado totalmente bagunçado, uma limpeza em três etapas lida com quase tudo: remova as quebras de linha extras para juntar os parágrafos, remova as linhas vazias para limpar as lacunas e remova os espaços extras para normalizar qualquer espaço em branco duplicado ou perdido que a fonte deixou para trás. Como todas essas ferramentas são executadas no navegador, você pode limpar um documento confidencial sem que nada seja carregado. O resultado é um texto que parece e se comporta como se tivesse sido digitado corretamente.