クローラーとは
クローラー(Crawler)とは、インターネット上のWebページを自動的に巡回・収集するプログラムです。「ロボット」「ボット」「スパイダー」とも呼ばれ、GoogleのGooglebotが最も有名です。クロールしたデータを検索エンジンのインデックスに蓄積します。
Googlebotの動作原理
Googlebotはまず既知のURLリストからサイトを訪問し、ページ内のリンクをたどって新しいURLを継続的に発見します。HTMLのみならずCSSやJavaScriptも解析でき、JavaScriptで動的生成されるコンテンツもレンダリングして評価します。
クローラーをコントロールする方法
robots.txt:クローラーのアクセスをURLパターンで許可・拒否するテキストファイル。noindexタグ:特定ページをインデックスしないよう指示するmetaタグ。XMLサイトマップ:クロールしてほしいURLをまとめて提出する手段。これらを適切に設定することでクロール効率を最大化します。
クロールバジェットとは
Googlebotが1サイトに割り当てるクロール量の上限がクロールバジェットです。大規模サイト・低品質ページが多いサイトでは重要ページがクロールされない可能性があります。不要なURLのnoindex設定・薄いコンテンツの削除がクロールバジェット最適化の基本です。