テキストからすべての URL とリンクを抽出する方法
ページのリンクを監査する場合でも、ドキュメントからソースを収集する場合でも、エクスポートからすべてのリンクを抽出する場合でも、テキストを目視でスキャンし、URL を 1 つずつコピーするのは退屈で間違いが起こりやすいです。それらをすべて一度に抽出すると、雑用が 1 つのステップに変わります。ここでは、リンク抽出がどのように機能するか、そしてそれが本当に役立つ場合について説明します。
仕組み
URL エクストラクターはテキストをスキャンし、Web リンクの形状に一致するもの、つまり http:// または https:// で始まり、その後にドメインとパスが続くものをすべて抽出します。重複を削除して、それぞれを 1 行に 1 つずつ明確にリストします。記事、ドキュメント、生の HTML ソース、チャットのエクスポート、またはリンクを含むテキストを貼り付けると、URL だけが返されます。テキストを読んでリンクを探すよりもはるかに高速で信頼性が高く、段落の途中に埋もれているリンクも見逃すことがありません。
何が釣れ、何が釣れないのか
エクストラクターは、標準の完全な Web リンクをカバーするプロトコル、http:// または https:// プレフィックスを含む URL を照合します。通常、「example.com」など、プロトコルを使用せずに記述されたベア ドメインだけでは一致しません。これは、プレーン テキストではあいまいであるためです。 「example.com」は文の終わりまたはファイル名である可能性があります。ソースにプロトコルを使用せずに記述されたリンクがある場合は、プロトコルを追加する必要がある場合があります。プロトコルを含む実際のリンクの大部分では、抽出は信頼できます。
リンク抽出が役立つ場合
用途は複数のジョブにまたがります。 SEO スペシャリストはページからすべてのリンクを抽出し、壊れたターゲットや疑わしいターゲットがないかを監査します。研究者は文書からすべてのソース URL を抽出して、それらを確認またはアーカイブします。開発者は HTML またはログ ファイルからリンクを収集します。コンテンツ チームは下書きからすべてのリンクを収集し、公開前にすべてが機能することを確認します。マーケティング担当者はエクスポートから URL を抽出して参照リストを作成します。いずれの場合も、完全なリストを 1 ステップで取得することで、フォローアップ作業が可能になります。
他のツールと組み合わせる
多くの場合、抽出は最初のステップです。 URL のリストを取得したら、URL をアルファベット順に並べ替えてドメインごとにグループ化したり、複数のソースをマージした場合に残った重複を削除したり、プレフィックスとサフィックスを追加してレポートまたはコードの各ソースをラップしたりできます。すべてがブラウザーでローカルに実行されるため、機密文書の抽出、並べ替え、フォーマットなどのワークフロー全体を、デバイスから離れることなく実行できます。