外部リンク抽出ツール

生のHTMLを貼り付けると、そこに含まれるすべての外部リンクが重複なしのすっきりしたリストで取得できます。必要に応じてベースURLを入力すると、抽出ツールはどのホストを内部とみなすかを把握でき、それ以外のホストへのリンクが報告されます。リンク漏れや古いパートナーリンクの確認、外部リンクがポリシーの想定どおりの宛先に張られているかの確認に役立ちます。

外部リンクを抽出する方法

  1. 1

    ソースを提供

    ページの生のHTMLを貼り付けます。必要に応じてベースURLを追加すると、どのホストが内部かを抽出ツールが判別できます。空欄の場合はすべてのホストが外部として扱われます。

  2. 2

    抽出を実行

    すべての`<a href>`が読み取られ、ベースホストと異なるホストを持つ絶対http/httpsリンクだけが残されます。重複は削除されます。

  3. 3

    リストを確認

    1行につき1つの外部URLが出力され、スプレッドシートに貼り付けたり、個々のリンクを確認したりできます。

  4. 4

    結果を活用

    リストをクリップボードにコピーするか、ページを開いたまま各宛先を新しいタブで確認します。

抽出ツールが外部とみなすもの

リンクは、そのホストが指定したベースURLと異なる場合に外部とみなされます(比較は大文字小文字を区別しません)。サブドメインは別ホストとして扱われるため、blog.example.comwww.example.comにとって外部です。サブドメイン全体を対象に監査する場合は、ベースURLからサブドメインを取り除いてください。ベースURLを空欄にすると、すべてのhttp/httpsリンクが外部として一覧表示されます。

抽出ツールが報告するのは宛先URLのみです。アンカーテキストやrel属性は読み取らないため、nofollowugcsponsoredの各トークンは元のHTMLで直接確認してください。

無視される対象

  • mailto:tel:javascript:、およびフラグメントのみの#のhref。
  • 相対URLや//cdn.example.comのようなプロトコル相対URL(数えたい場合は貼り付けたHTML内で絶対URLに展開してください)。
  • hrefのないアンカータグ(これらはナビゲーション可能なリンクではありません)。

ヒント

  • ページがJavaScriptを使用する場合はレンダリング後のHTMLを貼り付けます。 フレームワークがクライアント側で生成するリンクは、レンダリングされたDOMを貼り付けたときだけ現れます(例:DevToolsからouterHTMLをコピー)。
  • トラッキング用ラッパーに注意します。 /go//out/を経由するアフィリエイトリダイレクトは実際の宛先を隠すことがあります。抽出ツールはラッパーのURLをそのまま返すため、宛先が不自然な場合は生のhrefを確認してください。
  • 比較前に正規化します。 フラグメントやトラッキングパラメータが異なるURLは別リンクとして数えられるため、抽出結果を2回比較する前にURLを正規化してください。
  • 時間を置いて比較します。 毎月抽出ツールを実行してリストを差分比較します。自分で追加していない新しい外部リンクは、テーマやプラグインが侵害された最初の兆候です。

よくある質問

HTMLに書かれている通りのhrefを抽出します。すべてのリダイレクトを追跡するとレポートの生成が大幅に遅くなり、宛先のボット保護が作動する可能性もあります。最終的なランディングURLが必要な場合は、別途解決してください。

いいえ。抽出ツールは渡されたHTMLをそのまま解析します。フレームワークがクライアント側でレンダリングするリンクは、レンダリング済みのDOMを貼り付けた場合にのみ表示されます(例:DevToolsからouterHTMLをコピー)。

報告されるのは絶対http/https URLのみです。//cdn.example.comのようなプロトコル相対URL、相対パス、mailto:tel:のリンクはスキップされます。数えたい場合は貼り付けたHTML内で絶対URLに展開してください。

貼り付けたHTMLは、現在のリクエスト内で抽出を実行するためだけにサーバーへ送信されます。データベースやログには保存されず、レスポンスがブラウザに届いた後は何も保持されません。

関連ツール

このツールは他の言語でも利用できます