Robots.txtジェネレーター
対象とするクローラーを設定し、ブロックするパスと許可するパスを列挙し、任意のcrawl-delayを追加してサイトマップを指定すると、ジェネレーターが正しく整形されたrobots.txtを組み立て、コピーして配置できます。行の正確な書式や記号を処理してくれるので、構文やuser-agentのつづりを覚える必要はありません。
ファイルの生成方法
-
1
user-agentを設定する
ルールを適用するクローラーを入力するか、* のままにしてすべてのボットを対象にします。
-
2
ブロックするパスを列挙する
ブロックするディレクトリやパスを1行に1つずつ追加します(例: /admin/ や /checkout/)。
-
3
許可するパスを列挙する
クロール可能なままにしておくパスを1行に1つずつ追加し、より広いDisallowの中で例外を作ります。
-
4
サイトマップとcrawl-delayを追加する
サイトマップのURLを宣言し、必要ならcrawl-delayを秒単位で指定します。
-
5
コピーして配置する
生成されたファイルをコピーし、https://yourdomain.com/robots.txt に配置します。サブディレクトリではなくルートのみです。
よくあるスターターテンプレート
すべて許可(ほとんどのサイト):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
staging / 管理画面をブロック:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
AI学習クローラーをブロックし、検索エンジンを許可:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
知っておきたいuser-agent
| User-agent | 所有者 | 目的 |
|---|---|---|
| Googlebot | Google Search | ウェブのインデックス |
| Googlebot-Image | 画像検索 | |
| Google-Extended | Bard/Gemini の学習(オプトアウト可) | |
| Bingbot | Microsoft | Bing 検索 |
| DuckDuckBot | DuckDuckGo | DDG 検索 |
| GPTBot | OpenAI | ChatGPT / 学習(オプトアウト可) |
| ClaudeBot | Anthropic | Claude の学習(オプトアウト可) |
| CCBot | Common Crawl | 多くのLLMが使うコーパス |
| AhrefsBot | Ahrefs | SEOの被リンクインデックス |
| SemrushBot | Semrush | SEO調査 |
| MJ12bot | Majestic | SEO調査 |
AI学習ボットは慣習としてオプトアウト方式であり、法的義務ではありません。誠実な事業者はこれらの指示を尊重しますが、そうでない者は従いません。
パスマッチングのルール
- パスはドメインのルートからの相対で、
/で始まります。 *は任意の文字に一致します。Disallow: /*.pdf$はすべてのPDFをブロックします。$はURLの末尾に固定します。Disallow: /*/trash$は/foo/trashをブロックしますが、/foo/trashes/...はブロックしません。- 最長一致が優先されます。そのサブパスでは、
Allow: /admin/public/がDisallow: /admin/を上書きします。 - パスは大文字・小文字を区別します。
robots.txtにできないこと
- Googleからページを削除する。 ページ自体に
noindexメタタグを使ってください。 - URLを人間から守る。 robots.txtは公開されており、従順なボットへの提案にすぎません。
- Googlebotのクロール頻度を制限する。
Crawl-delayはGoogleに無視されます。Search Consoleを使ってください。 - robots.txtを無視するボットをブロックする。 迷惑スクレイパーはこのファイルを読みません。
公開チェックリスト
https://yourdomain.com/robots.txtに置きます。ルートのみです。Content-Type: text/plainで配信します(ほとんどのサーバーは自動で行います)。- サイズ: 500 KB未満。Googleはそれより大きいファイルを切り詰めます。
- 公開後、Google Search Consoleのrobots.txtテスターで取得されたファイルを確認します。
- Disallowを外すとき、インデックス解除に数週間かかることがあります。
よくある質問
必須ではありません。ない場合、クローラーは「すべて許可」とみなします。ブロックしたいもの(staging、管理画面、チェックアウト、サイト内検索など)があるなら必要です。
GPTBot、ClaudeBot、CCBot、Google-Extendedなどのuser-agentブロックで停止を求められます。主要な事業者はこれを尊重しますが、悪質なスクレイパーは完全に無視します。
クローラーは寛容で、未知のディレクティブは無視されます。深刻なエラー(HTTP 404や500)は「すべて許可」として扱われます。公開前にファイルを検証してください。
カバーしたい各ホストのルートです。https://www.example.com/robots.txtとhttps://example.com/robots.txtは別々のホスト用の別々のファイルです。
いいえ。入力したパスはファイルの組み立てにのみ使われ、保存もログ記録もされません。
関連ツール
ASCII表リファレンス
0から127までの完全なASCII表です。NUL、LF、DELなどの制御コードを含め、各文字の10進数、16進数、8進数、2進数、HTML数値文字参照を表示します。
HTML文字参照
HTMLエンティティの検索可能なリスト、その名称コードおよび数値コード、および特殊文字や記号のワンクリックコピー機能を提供します。
キーボードショートカット一覧
macOS、Windows、Linux向けに、VS Code、Chrome、GNU Readlineを使うBashの公式資料に基づく既定ショートカットを検索できます。
JavaScript圧縮ツール
変数名のリネーム、空白の削除、デッドコードの除去、定数畳み込みでJavaScriptを圧縮し、より小さなバンドルを作成します。
EditorConfig ジェネレーター
インデント、改行コード、文字コードのルールから .editorconfig を作成し、リポジトリで使っている言語ごとに正しいセクションを追加します。Python、Go、YAML、Makefile などに対応。
メールアドレス検証ツール
メールアドレスを検証します。RFC 5322構文チェック、MXレコードのライブ確認に加え、ローカル部、ドメイン、長さの詳細を表示します。メールは送信されません。
このツールは他の言語でも利用できます
- Robots.txt-generator [NL]
- Générateur de Robots.txt [FR]
- مولد ملفات robots.txt [AR]
- Generator robots.txt [PL]
- Generator Robots.txt [ID]
- Robots.txt-Generator [DE]
- Generador de Robots.txt [ES]
- เครื่องมือสร้างไฟล์ robots.txt [TH]
- Robots.txt-generator [SV]
- Bộ tạo file robots.txt [VI]
- Robots.txt 생성기 [KO]
- Gerador de Robots.txt [PT]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]
- Генератор robots.txt [RU]
- Robots.txt Oluşturucu [TR]
- Robots.txt 生成器 [ZH]