【ロボッツテキスト】

robots.txt とは?

最終更新:
💡 クローラーに渡す、巡回ルールの案内

サイトの最上位パスに置く /robots.txt で、クローラーに巡回してよいURLの範囲を伝える仕組み。従うクローラーの巡回を制御する規約であり、認証によるアクセス制限や検索結果からの確実な除外とは異なる。

📌 このページのポイント
クローラーに渡す、巡回ルールの案内 従うクローラーへ巡回ルールを伝える 📄 /robots.txt User-agent: * Disallow: /admin/ 各指定は別々の行 専用グループのない クローラー向けの例 🤖 従うボット /admin/を巡回しない 🤖 従わない場合 アクセスを防げない 矢印はルールの提示。通信の遮断ではない 🔒 非公開情報 認証・アクセス制御 で守る 🔍 検索への掲載 巡回制御とは別 noindex等を検討
公開したrobots.txtのルールをクローラーが参照する概念図。従うクローラーの巡回を制御するもので、認証の代わりにはならない。Googleでnoindexを読み取らせるには、そのページへの巡回を妨げないことも必要。
ひよこ ひよこ
robots.txtは何をするファイル?
ペンギン先生 ペンギン先生
クローラーに「この範囲は巡回しないで」と伝えるルール表だよ。たとえば https://example.com/robots.txt のように、サイトの最上位パスへ置く。ファイルを見たクローラーが、対象のルールに従って巡回するんだ。
ひよこ ひよこ
どんな書き方をするの?
ペンギン先生 ペンギン先生
例として、1行目に「User-agent: *」、次の行に「Disallow: /admin/」と書くよ。専用グループのないクローラーに、/admin/ 以下を巡回しないよう伝える。Allowで許可するパスも書ける。各指定は別々の行にするんだ。
ひよこ ひよこ
これで管理ページを守れる?
ペンギン先生 ペンギン先生
認証の代わりにはならないよ。ルールに従わないボットもアクセスできるし、robots.txt自体は公開される。管理ページや非公開情報は、サーバー側の認証やアクセス制御で守るんだ。
ひよこ ひよこ
検索結果からも消えるの?
ペンギン先生 ペンギン先生
巡回禁止と検索への掲載禁止は別だよ。Googleは、他のページからのリンクなどで知ったURLを、内容を巡回しなくても検索結果に載せる場合がある。noindexを使うなら、Googleがその指定を読み取れるようにする必要もあるんだ。
ひよこ ひよこ
AI向けの拒否も全部これで済む?
ペンギン先生 ペンギン先生
サービスが対応している識別子やルール、対象用途を確認するよ。検索用とAI向けで扱いが違う場合もある。robots.txtを書くだけで、あらゆるAIによる取得や利用を一律に防げるとは言えないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「robots.txt」って出てきたら「クローラーに伝えるサイトの巡回ルール」と思えばだいたいOK!
📖 おまけ:英語の意味
「robots.txt」 = ロボット用テキストファイル
💬 robotsは自動巡回プログラムを指すよ。1994年にMartijn Kosterが定義したRobots Exclusion Protocolをもとに、2022年にRFC 9309として標準化されたんだ。

参考資料

← 用語集にもどる