Robots.txtチェッカー
robots.txtのルールと確認したいURLパスを貼り付けると、チェッカーがAllowとDisallowの行を読み取り、そのパスがブロックされるか許可されるかを判定します。ページが突然Googleから消えたときに、厳しすぎるDisallowが原因かどうかを確かめたり、新しいルールを作成してファイルを公開する前にパスを検証したりするのに便利です。
チェッカーの使い方
-
1
ルールを貼り付ける
robots.txtのAllowとDisallowの行を欄にコピーするか、試したい新しい行を入力します。
-
2
テストするパスを入力する
確認したいURLパスを入力します(例: /private/page)。ドメイン全体ではなく、パスのみを使用してください。
-
3
ルールを確認する
チェッカーがAllowとDisallowの行を調べ、入力したパスに一致するルールを見つけます。
-
4
結果を読む
見つかったルールの数、テストしたパス、そして判定結果(デフォルトで許可、Disallowによりブロック、またはAllowにより許可)が表示されます。
最小限の正しいrobots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *. 他のブロックで明示的に指定されていないすべてのクローラーに適用されます。
- Allow: /. デフォルトですべて許可されます。
- Disallow: /admin/. 管理ディレクトリはアクセス不可です。
- Sitemap:. XMLサイトマップの場所を検索エンジンに伝えます。
Googlebotが実際に従うルール
Googleのパーサーは、曖昧なルールを解釈するための事実上の標準です。
- パスは大文字・小文字を区別します。
/Admin/と/admin/は別物です。 - 最長一致が優先されます。
/admin/public/で始まるURLでは、Allow: /admin/public/がDisallow: /admin/より優先されます。 - ワイルドカード。
*は任意の文字列に一致し、$はURLの末尾に固定します。 - コメントは
#で始まります。 - 順序に依存しません。 ルールは記述順ではなく、具体性(パスの長さ)で評価されます。
よくある間違い
| 間違い | 影響 |
|---|---|
Disallow: / を先頭に置き、Allowがない |
サイト全体がブロックされる |
Disallow: *.pdf |
多くのパーサーが無視する。Disallow: /*.pdf$を使う |
| Disallowにプロトコル相対URLや絶対URLを指定 | 無視される。パスは相対でなければならない |
ルールの前に複数のUser-agent行 |
まとめられ、ルールは列挙したすべてのUAに適用される |
| パス末尾の空白 | 黙って別のパスとして扱われる |
| robots.txtをサブディレクトリに置く | ルートドメインのファイルのみが取得される |
robots.txtとnoindexの違い
robots.txtはクローラーにURLを取得しないよう指示します。すでにインデックスされたページをその後robots.txtでブロックしても、数か月間インデックスに残ることがあります。クローラーがそのページを取得して削除を確認できないためです。インデックスから外したい場合は、ページ自体にnoindexメタタグまたはHTTPヘッダーを設定し、クローラーがそれを認識できるようにしてください。
Crawl-delay
Crawl-delay: 10はリクエスト間を10秒空けるよう要求します。Googleはこれを無視します(クロール頻度はSearch Consoleで設定します)。Bing、Yandex、一部のニッチなクローラーはこれを尊重します。ニッチなボットによるクロール負荷が大きい小規模サイトで使います。
Disallowができないこと
- 他サイトからのリンクを防ぐこと。 他のサイトは禁止されたURLへリンクでき、そのURLはタイトルや説明なしのURLだけで検索結果に表示されることがあります。
- ページの表示を防ぐこと。 ユーザーは依然としてDisallowされたURLにアクセスできます。
- URLを世間から隠すこと。 robots.txtは公開されており、そこに秘密のパスを列挙すると、かえってその存在を知らせてしまいます。
よくある質問
Disallowはインデックス登録ではなくクロールをブロックするためです。GoogleがすでにそのURLを(リンクやサイトマップから)把握している場合、URLだけを検索結果に残すことがあります。ページにnoindexタグを設定し、Googleに取得させて削除を確認させてください。
はい。独自のルールを持つUser-agent: BadBotブロックを使います。ただし、行儀の悪いボットはrobots.txtを完全に無視します。従うのは行儀のよいボットだけです。
いいえ。robots.txtは公開されているため、記載するとその場所を教えてしまいます。代わりに認証とサーバーレベルのアクセス制御を使ってください。
はい、パスについては区別します。Disallow: /Admin/は/admin/をブロックしません。実際のURLの大文字・小文字に合わせてください。
はい。Sitemap:の行を複数並べれば、別々のXMLサイトマップやサイトマップインデックスを指定できます。
関連ツール
外部リンク抽出ツール
生のHTMLを貼り付け、必要に応じてベースURLを指定すると、コード内の外部http/httpsリンクを重複なしで一覧表示します。リンク監査やSEOレビューに最適です。
メタディスクリプション長チェッカー
メタディスクリプションの文字数と推定ピクセル幅を測り、編集上の目安やデスクトップ・モバイルのレイアウト例と比較します。
FAQスキーマ生成ツール
質問と回答のペアからFAQPageのJSON-LDマークアップを生成します。Googleのリッチリザルトや強調スニペットの対象になるための構造化データを数秒で用意できます。
インデックス可能性チェッカー
URLがインデックス対象であるかを確認してください:robots.txt、meta robots、X-Robots-Tag、正規化信号およびHTTPステータス。
バックリンクアンカーテキスト分析ツール
バックリンク、CSV行、URL | アンカーのペア、またはアンカーテキスト行を貼り付け、重複を数えて Anchor Text,Count,Share のCSVを出力します。
内部リンク抽出ツール
URLまたは貼り付けたHTMLから、アンカーテキスト・rel属性・nofollowステータスを含むすべての内部リンクを抽出。SEO監査に役立ちます。
このツールは他の言語でも利用できます
- Robots.txt-checker [NL]
- Vérificateur de Robots.txt [FR]
- أداة فحص ملف robots.txt [AR]
- Sprawdzanie robots.txt [PL]
- Pemeriksa Robot.txt [ID]
- Robots.txt-Prüfer [DE]
- Verificador de robots.txt [ES]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- Robots.txt 검사기 [KO]
- Verificador de Robots.txt [PT]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]
- Robots.txt 检查器 [ZH]