【くろーらー】

クローラー(Webクローラー) とは?

最終更新:
💡 リンクをたどって、Webを見に行くロボット

Webページなどを自動的に取得し、巡回するプログラム。検索エンジンでは、リンクやサイトマップなどで見つけたURLを取得する。クロール、内容を分析して登録するインデックス作成、検索結果の表示は別の段階であり、取得だけで検索掲載が決まるわけではない。

📌 このページのポイント
クローラー:見つけたページを取得リンクなどURLを発見クローラーページを取得検索の次の段階内容を分析登録を判断検索結果検索語句に応じる取得しただけで、検索掲載は決まらない
Google検索を簡略化した例。クロール後にインデックス作成、検索結果の表示という別の段階があり、すべてのページが進めるとは限りません。
ひよこ ひよこ
クローラーは、何をしているの?
ペンギン先生 ペンギン先生
Webページなどを自動で取りに行くプログラムだよ。Google検索のGooglebotが一例だね。人が一つずつブラウザで開く代わりに、プログラムが巡回するイメージだよ。
ひよこ ひよこ
ページはどうやって見つける?
ペンギン先生 ペンギン先生
すでに知っているページのリンクや、サイトマップなどからURLを見つけるよ。ただしGooglebotが見つけたページを全部、すぐに取得するとは限らないんだ。
ひよこ ひよこ
来てくれたら、検索に載る?
ペンギン先生 ペンギン先生
取得するクロールと、内容を分析して登録するインデックス作成は別だよ。Googleではその後に、検索語句に合う結果を選ぶ段階もある。クロールされたことだけでは掲載や順位は保証されないね。
ひよこ ひよこ
robots.txtで、見せないようにできる?
ペンギン先生 ペンギン先生
従うクローラーへ、取得してよい範囲を伝えるファイルだよ。強制的にアクセスを防ぐ認証ではない。秘密のページはパスワードなどで保護し、robots.txtだけに任せないことが大切だね。
ひよこ ひよこ
検索結果から消したいときもrobots.txt?
ペンギン先生 ペンギン先生
Googleでは、取得を禁止しても他のページから知られたURLが検索結果に出る場合がある。検索への登録を止めるnoindexとは別の役割だよ。noindexを読み取ってもらうには、そのページへGooglebotがアクセスできる必要があるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「クローラー」って出てきたら「Webを自動巡回してページを取得するプログラム」と思えばだいたいOK!
📖 おまけ:英語の意味
「Crawler」 = 這い回るもの
💬 Crawlは「這って進む」。リンクをたどってウェブを這うように巡回するからこの名前だよ。スパイダー(蜘蛛)とも呼ばれる

参考資料

← 用語集にもどる