Googleのような検索エンジンは、とても仕事が速いstaffがいる、巨大な図書館のようなものです。誰かの質問に答えるpageを手渡す前に、検索エンジンはいつも同じ順番で3つの仕事をします。
1. クロール(Crawl)
「クローラー」(または「bot」)と呼ばれるprogramを、図書館のすべての通路を歩く案内係だと思ってください。linkをたどってpageからpageへ移動し、訪れてほしいpageの一覧であるsitemap.xmlというfileも読みます。
robots.txtというfileは、扉に貼られた小さな案内板のようなものです。どの部屋に入ってよいかをクローラーに伝えます。ただし、この案内板を出しただけでは、pageが検索結果から消えるわけではありません。案内係が中に入るのをやめるだけです。
2. インデックス(Index)
クローラーがpageを訪れたあと、検索エンジンはそのpageを読み込み、indexと呼ばれる巨大な一覧に書き込みます。図書館の総合目録のようなものです。この一覧に載ったpageだけが、検索している人に手渡されます。
noindexというruleで、pageをこの一覧から外すよう求めることもできます。これはrobots.txtとは違います。noindexは目録からpageを取り除きますが、robots.txtは案内係が最初から部屋に入るのを止めるだけです。
3. ランキング(Rank)
誰かが受付で質問をする(検索する)と、検索エンジンは一覧にあるすべてのpageを見て、どれがいちばんよくその質問に答えるか、そしてどの順番で手渡すかを決めます。この順番が「順位(rank)」です。順位に影響する要素は多く、正確なruleは公開されていません。
なぜ重要か
この3つの段階は、ドミノのように厳密な順番で起こります。最初の段階を飛ばしたpageは、あとの段階にたどり着けません。