Jak vyhledávací roboti procházejí a indexují web

2

Vyhledávače nenacházejí výsledky zázračně. Používají roboty. Konkrétněji používají takzvané vyhledávací roboty (pavouky) nebo webové prohledávače. Tyto automatizované programy procházejí internet, aby vytvořily databázi všech webů a stránek, které mohou najít. Bez nich neexistuje žádný index. A bez indexu nemůže vyhledávač při zadání dotazu nic zobrazit.

Tento proces je mechanický. Roboti tvoří fronty adres URL k návštěvě. Když robot přistane na konkrétním webu, podívá se nejen na domovskou stránku. Přečte text. Analyzuje kód. Kontroluje meta tagy – specifická, formátovaná klíčová slova navržená tak, aby je četly stroje, nikoli lidé. Vytváří mapu hypertextových odkazů. Všechna tato data tvoří profil, který je odeslán zpět do vyhledávače.

Zde je mechanická realita: robot sleduje odkazy ze stránky na stránku. Proto na zpětných odkazech záleží. Pokud váš web obsahuje odkazy z jiných míst, roboti vás najdou rychleji. Pokud nemáte odkazy, jste ve frontě prakticky neviditelní.

Čtyři režimy bypassu

Roboti se nepotulují jen tak náhodně. Fungují v různých režimech, aby spravovaly obrovské množství internetu.

  1. Režim výběru
    Jeden typ robota je zodpovědný za počáteční procházení. Upřednostňuje stránky k návštěvě a kontroluje, zda již nebyla načtena předchozí verze stránky. Sestaví úvodní mapu.

  2. Režim opětovné návštěvy
    Stránky nezůstávají statické. Tento režim cílí na stránky, které již byly indexovány. Kontroluje aktualizace. Pokud se obsah změnil, index by to měl odrážet.

  3. Režim zdvořilosti
    Servery mají omezení. Pokud robot příliš zatěžuje stránku, může ji srazit nebo zpomalit pro skutečné uživatele. Aby se tomu zabránilo, některé vyhledávače používají „slušnost“. Omezuje, jak často se robot vrací na stejnou stránku, čímž zajišťuje, že servery nebudou přetíženy.

  4. Režim paralelizace
    Internet je příliš velký pro jednoho robota. Paralelizace umožňuje robotům koordinovat své akce. Pokud více robotů prochází stejnou stránku, tento režim jim pomáhá komunikovat a vyhnout se zbytečnému zdvojování práce.

Roboti vs. indexátoři: proces sestávající ze dvou kroků

Mezi prohledávačem a indexátorem často dochází k záměně. Jedná se o různé nástroje.

Robot je počítačový program, který automaticky shromažďuje nebo „prolézá“ informace na internetu. Indexer vyhledávače je program, který čte informace shromážděné robotem a na jejich základě vytváří index.

Robot je online. Sbírá suroviny. Indexátor zůstává na svém místě. Tento materiál zpracovává. Vytváří knihovnu. Je to index, který umožňuje vyhledávači vrátit relevantní výsledky, když uživatel zadá dotaz. Žádný robot – žádná data. Žádný indexátor – žádné vyhledávání.

Proč se webovým prohledávačům říká pavouci?

Název je doslovný. Pavouci lezou. Sledují vlákna. Webové prohledávače sledují hypertextové odkazy podobně jako pavouk sleduje vlákna webu. Je to stará analogie, ale stále platí. Pohybují se od uzlu k uzlu a shromažďují data za pochodu.

Internet je labyrint. Pavouci jsou krysy. A vyhledávač je strážcem labyrintu. Chceš jen najít cestu ven.