Robots.txtチェッカー

robots.txtのルールと確認したいURLパスを貼り付けると、チェッカーがAllowとDisallowの行を読み取り、そのパスがブロックされるか許可されるかを判定します。ページが突然Googleから消えたときに、厳しすぎるDisallowが原因かどうかを確かめたり、新しいルールを作成してファイルを公開する前にパスを検証したりするのに便利です。

チェッカーの使い方

  1. 1

    ルールを貼り付ける

    robots.txtのAllowとDisallowの行を欄にコピーするか、試したい新しい行を入力します。

  2. 2

    テストするパスを入力する

    確認したいURLパスを入力します(例: /private/page)。ドメイン全体ではなく、パスのみを使用してください。

  3. 3

    ルールを確認する

    チェッカーがAllowとDisallowの行を調べ、入力したパスに一致するルールを見つけます。

  4. 4

    結果を読む

    見つかったルールの数、テストしたパス、そして判定結果(デフォルトで許可、Disallowによりブロック、またはAllowにより許可)が表示されます。

最小限の正しいrobots.txt

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. 他のブロックで明示的に指定されていないすべてのクローラーに適用されます。
  • Allow: /. デフォルトですべて許可されます。
  • Disallow: /admin/. 管理ディレクトリはアクセス不可です。
  • Sitemap:. XMLサイトマップの場所を検索エンジンに伝えます。

Googlebotが実際に従うルール

Googleのパーサーは、曖昧なルールを解釈するための事実上の標準です。

  • パスは大文字・小文字を区別します。 /Admin//admin/は別物です。
  • 最長一致が優先されます。 /admin/public/で始まるURLでは、Allow: /admin/public/Disallow: /admin/より優先されます。
  • ワイルドカード。 *は任意の文字列に一致し、$はURLの末尾に固定します。
  • コメント#で始まります。
  • 順序に依存しません。 ルールは記述順ではなく、具体性(パスの長さ)で評価されます。

よくある間違い

間違い 影響
Disallow: / を先頭に置き、Allowがない サイト全体がブロックされる
Disallow: *.pdf 多くのパーサーが無視する。Disallow: /*.pdf$を使う
Disallowにプロトコル相対URLや絶対URLを指定 無視される。パスは相対でなければならない
ルールの前に複数のUser-agent まとめられ、ルールは列挙したすべてのUAに適用される
パス末尾の空白 黙って別のパスとして扱われる
robots.txtをサブディレクトリに置く ルートドメインのファイルのみが取得される

robots.txtとnoindexの違い

robots.txtはクローラーにURLを取得しないよう指示します。すでにインデックスされたページをその後robots.txtでブロックしても、数か月間インデックスに残ることがあります。クローラーがそのページを取得して削除を確認できないためです。インデックスから外したい場合は、ページ自体にnoindexメタタグまたはHTTPヘッダーを設定し、クローラーがそれを認識できるようにしてください。

Crawl-delay

Crawl-delay: 10はリクエスト間を10秒空けるよう要求します。Googleはこれを無視します(クロール頻度はSearch Consoleで設定します)。Bing、Yandex、一部のニッチなクローラーはこれを尊重します。ニッチなボットによるクロール負荷が大きい小規模サイトで使います。

Disallowができないこと

  • 他サイトからのリンクを防ぐこと。 他のサイトは禁止されたURLへリンクでき、そのURLはタイトルや説明なしのURLだけで検索結果に表示されることがあります。
  • ページの表示を防ぐこと。 ユーザーは依然としてDisallowされたURLにアクセスできます。
  • URLを世間から隠すこと。 robots.txtは公開されており、そこに秘密のパスを列挙すると、かえってその存在を知らせてしまいます。

よくある質問

Disallowはインデックス登録ではなくクロールをブロックするためです。GoogleがすでにそのURLを(リンクやサイトマップから)把握している場合、URLだけを検索結果に残すことがあります。ページにnoindexタグを設定し、Googleに取得させて削除を確認させてください。

はい。独自のルールを持つUser-agent: BadBotブロックを使います。ただし、行儀の悪いボットはrobots.txtを完全に無視します。従うのは行儀のよいボットだけです。

いいえ。robots.txtは公開されているため、記載するとその場所を教えてしまいます。代わりに認証とサーバーレベルのアクセス制御を使ってください。

はい、パスについては区別します。Disallow: /Admin//admin/をブロックしません。実際のURLの大文字・小文字に合わせてください。

はい。Sitemap:の行を複数並べれば、別々のXMLサイトマップやサイトマップインデックスを指定できます。

関連ツール

このツールは他の言語でも利用できます