【くろーらー】
クローラー(Webクローラー) とは?
最終更新:
💡 リンクをたどって、Webを見に行くロボット
Webページなどを自動的に取得し、巡回するプログラム。検索エンジンでは、リンクやサイトマップなどで見つけたURLを取得する。クロール、内容を分析して登録するインデックス作成、検索結果の表示は別の段階であり、取得だけで検索掲載が決まるわけではない。
📌 このページのポイント
- リンクやサイトマップなどからURLを見つけ、ページを取得する
- Google検索ではクロール・インデックス作成・検索結果表示を分けて考える
- robots.txtは巡回のルール。アクセス認証の代わりにはならない
- robots.txtで禁止したURLも、検索結果に出る場合がある
クローラーは、何をしているの?
ページはどうやって見つける?
来てくれたら、検索に載る?
robots.txtで、見せないようにできる?
従うクローラーへ、取得してよい範囲を伝えるファイルだよ。強制的にアクセスを防ぐ認証ではない。秘密のページはパスワードなどで保護し、robots.txtだけに任せないことが大切だね。
検索結果から消したいときもrobots.txt?
まとめ:ざっくりこれだけ覚えればOK!
「クローラー」って出てきたら「Webを自動巡回してページを取得するプログラム」と思えばだいたいOK!
📖 おまけ:英語の意味
「Crawler」 = 這い回るもの
💬 Crawlは「這って進む」。リンクをたどってウェブを這うように巡回するからこの名前だよ。スパイダー(蜘蛛)とも呼ばれる