So extrahieren Sie alle URLs und Links aus Text
Unabhängig davon, ob Sie die Links einer Seite überprüfen, Quellen aus einem Dokument sammeln oder jeden Link aus einem Export herausziehen, ist das Scannen von Text nach Augenmaß und das Kopieren von URLs einzeln mühsam und leicht zu verwechseln. Wenn Sie sie alle auf einmal extrahieren, wird aus einer lästigen Aufgabe ein einziger Schritt. Hier erfahren Sie, wie die Linkextraktion funktioniert und wo sie wirklich nützlich ist.
Wie es funktioniert
Ein URL-Extraktor scannt Ihren Text und extrahiert alles, was der Form eines Weblinks entspricht, also alles, was mit http:// oder https:// beginnt, gefolgt von einer Domain und einem Pfad. Es listet jeden sauber auf, einen pro Zeile, wobei Duplikate entfernt werden. Fügen Sie einen Artikel, ein Dokument, eine Roh-HTML-Quelle, einen Chat-Export oder einen beliebigen Text mit Links ein, und Sie erhalten nur die URLs zurück. Es ist weitaus schneller und zuverlässiger als das Durchlesen des Textes auf der Suche nach Links, und es übersieht nicht die in der Mitte eines Absatzes verborgenen Links.
Was es fängt und was nicht
Der Extraktor gleicht URLs ab, die das Protokoll und das Präfix http:// oder https:// enthalten, das standardmäßige, vollständige Weblinks abdeckt. Im Allgemeinen werden keine reinen Domänen gefunden, die ohne Protokoll geschrieben wurden, wie beispielsweise „example.com“, da diese im Klartext mehrdeutig sind. „example.com“ könnte das Ende eines Satzes oder ein Dateiname sein. Wenn Ihre Quelle Links enthält, die ohne das Protokoll geschrieben wurden, müssen Sie es möglicherweise hinzufügen. Für die überwiegende Mehrheit der echten Links, die das Protokoll enthalten, ist die Extraktion zuverlässig.
Wo Linkextraktion nützlich ist
Die Einsatzmöglichkeiten erstrecken sich über mehrere Arbeitsplätze. SEO-Spezialisten extrahieren alle Links einer Seite, um sie auf fehlerhafte oder verdächtige Ziele zu prüfen. Forscher ziehen jede Quell-URL aus einem Dokument, um sie zu überprüfen oder zu archivieren. Entwickler sammeln Links aus HTML- oder Protokolldateien. Content-Teams sammeln jeden Link eines Entwurfs, um vor der Veröffentlichung zu überprüfen, ob er alle funktioniert. Vermarkter extrahieren URLs aus Exporten, um eine Referenzliste zu erstellen. In jedem Fall ist es die vollständige Auflistung in einem Schritt, die die Nacharbeit erst ermöglicht.
Kombination mit anderen Werkzeugen
Die Extraktion ist oft der erste Schritt. Sobald Sie die Liste der URLs haben, können Sie sie alphabetisch sortieren, um sie nach Domäne zu gruppieren, alle verbleibenden Duplikate entfernen, wenn Sie mehrere Quellen zusammengeführt haben, oder ein Präfix und Suffix hinzufügen, um jede einzelne für einen Bericht oder einen Codeabschnitt zu umschließen. Da alles lokal im Browser ausgeführt wird, können Sie den gesamten Arbeitsablauf – Extrahieren, Sortieren, Formatieren – an einem vertraulichen Dokument durchführen, ohne dass etwas davon Ihr Gerät verlässt.