Robots.txtジェネレーター

対象とするクローラーを設定し、ブロックするパスと許可するパスを列挙し、任意のcrawl-delayを追加してサイトマップを指定すると、ジェネレーターが正しく整形されたrobots.txtを組み立て、コピーして配置できます。行の正確な書式や記号を処理してくれるので、構文やuser-agentのつづりを覚える必要はありません。

ファイルの生成方法

  1. 1

    user-agentを設定する

    ルールを適用するクローラーを入力するか、* のままにしてすべてのボットを対象にします。

  2. 2

    ブロックするパスを列挙する

    ブロックするディレクトリやパスを1行に1つずつ追加します(例: /admin/ や /checkout/)。

  3. 3

    許可するパスを列挙する

    クロール可能なままにしておくパスを1行に1つずつ追加し、より広いDisallowの中で例外を作ります。

  4. 4

    サイトマップとcrawl-delayを追加する

    サイトマップのURLを宣言し、必要ならcrawl-delayを秒単位で指定します。

  5. 5

    コピーして配置する

    生成されたファイルをコピーし、https://yourdomain.com/robots.txt に配置します。サブディレクトリではなくルートのみです。

よくあるスターターテンプレート

すべて許可(ほとんどのサイト):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

staging / 管理画面をブロック:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

AI学習クローラーをブロックし、検索エンジンを許可:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

知っておきたいuser-agent

User-agent 所有者 目的
Googlebot Google Search ウェブのインデックス
Googlebot-Image Google 画像検索
Google-Extended Google Bard/Gemini の学習(オプトアウト可)
Bingbot Microsoft Bing 検索
DuckDuckBot DuckDuckGo DDG 検索
GPTBot OpenAI ChatGPT / 学習(オプトアウト可)
ClaudeBot Anthropic Claude の学習(オプトアウト可)
CCBot Common Crawl 多くのLLMが使うコーパス
AhrefsBot Ahrefs SEOの被リンクインデックス
SemrushBot Semrush SEO調査
MJ12bot Majestic SEO調査

AI学習ボットは慣習としてオプトアウト方式であり、法的義務ではありません。誠実な事業者はこれらの指示を尊重しますが、そうでない者は従いません。

パスマッチングのルール

  • パスはドメインのルートからの相対で、/で始まります。
  • *は任意の文字に一致します。Disallow: /*.pdf$はすべてのPDFをブロックします。
  • $はURLの末尾に固定します。Disallow: /*/trash$/foo/trashをブロックしますが、/foo/trashes/...はブロックしません。
  • 最長一致が優先されます。そのサブパスでは、Allow: /admin/public/Disallow: /admin/を上書きします。
  • パスは大文字・小文字を区別します。

robots.txtにできないこと

  • Googleからページを削除する。 ページ自体にnoindexメタタグを使ってください。
  • URLを人間から守る。 robots.txtは公開されており、従順なボットへの提案にすぎません。
  • Googlebotのクロール頻度を制限する。 Crawl-delayはGoogleに無視されます。Search Consoleを使ってください。
  • robots.txtを無視するボットをブロックする。 迷惑スクレイパーはこのファイルを読みません。

公開チェックリスト

  1. https://yourdomain.com/robots.txtに置きます。ルートのみです。
  2. Content-Type: text/plainで配信します(ほとんどのサーバーは自動で行います)。
  3. サイズ: 500 KB未満。Googleはそれより大きいファイルを切り詰めます。
  4. 公開後、Google Search Consoleのrobots.txtテスターで取得されたファイルを確認します。
  5. Disallowを外すとき、インデックス解除に数週間かかることがあります。

よくある質問

必須ではありません。ない場合、クローラーは「すべて許可」とみなします。ブロックしたいもの(staging、管理画面、チェックアウト、サイト内検索など)があるなら必要です。

GPTBot、ClaudeBot、CCBot、Google-Extendedなどのuser-agentブロックで停止を求められます。主要な事業者はこれを尊重しますが、悪質なスクレイパーは完全に無視します。

クローラーは寛容で、未知のディレクティブは無視されます。深刻なエラー(HTTP 404や500)は「すべて許可」として扱われます。公開前にファイルを検証してください。

カバーしたい各ホストのルートです。https://www.example.com/robots.txthttps://example.com/robots.txtは別々のホスト用の別々のファイルです。

いいえ。入力したパスはファイルの組み立てにのみ使われ、保存もログ記録もされません。

関連ツール

このツールは他の言語でも利用できます