Jak roboty wyszukujące przeszukują i indeksują sieć

6

Wyszukiwarki nie znajdują wyników w magiczny sposób. Używają botów. Mówiąc dokładniej, wykorzystują tak zwane roboty wyszukujące (pająki) lub roboty indeksujące. Te zautomatyzowane programy przeszukują Internet w celu utworzenia bazy danych zawierającej wszystkie znalezione witryny i strony. Bez nich nie ma indeksu. A bez indeksu wyszukiwarka nie może nic wyświetlić po wpisaniu zapytania.

Proces ten ma charakter mechaniczny. Roboty tworzą kolejki adresów URL do odwiedzenia. Kiedy robot trafia na konkretną witrynę, przegląda więcej niż tylko stronę główną. Czyta tekst. Analizuje kod. Sprawdza metatagi — specyficzne, sformatowane słowa kluczowe przeznaczone do odczytania przez maszyny, a nie ludzi. Buduje mapę hiperłączy. Wszystkie te dane tworzą profil, który jest odsyłany do wyszukiwarki.

Oto mechaniczna rzeczywistość: robot podąża za linkami ze strony na stronę. Dlatego linki zwrotne mają znaczenie. Jeśli Twoja witryna zawiera linki z innych miejsc, roboty szybciej Cię znajdą. Jeśli nie masz linków, jesteś w rzeczywistości niewidoczny dla kolejki.

Cztery tryby obejścia

Roboty nie krążą po prostu losowo. Działają w różnych trybach, aby zarządzać ogromną skalą Internetu.

  1. Tryb selekcji
    Za początkowe pełzanie odpowiedzialny jest jeden typ robota. Nadaje priorytet stronom do odwiedzenia i sprawdza, czy poprzednia wersja strony została już załadowana. Buduje początkową mapę.

  2. Tryb ponownej wizyty
    Strony nie pozostają statyczne. Ten tryb dotyczy stron, które zostały już zaindeksowane. Sprawdza dostępność aktualizacji. Jeżeli treść uległa zmianie, indeks powinien to odzwierciedlać.

  3. Tryb grzeczności
    Serwery mają ograniczenia. Jeśli robot zbytnio obciąży witrynę, może ją zawiesić lub spowolnić dla prawdziwych użytkowników. Aby temu zapobiec, niektóre wyszukiwarki stosują „grzeczność”. Ogranicza częstotliwość powrotu robota na tę samą stronę, dbając o to, aby serwery nie były przeciążone.

  4. Tryb równoległy
    Internet jest za duży dla jednego bota. Równoległość pozwala robotom koordynować swoje działania. Jeśli tę samą stronę przegląda wiele robotów, ten tryb pomaga im w komunikacji i pozwala uniknąć niepotrzebnego powielania pracy.

Roboty kontra indeksatory: proces dwuetapowy

Często zdarza się, że robot indeksujący jest mylony z indeksatorem. To są różne instrumenty.

Robot to program komputerowy, który automatycznie zbiera lub „przeszukuje” informacje w Internecie. Indeksator wyszukiwarki to program, który odczytuje informacje zebrane przez robota i tworzy na ich podstawie indeks.

Robot przechodzi do trybu online. Zbiera surowiec. Indeksator pozostaje na swoim miejscu. Przetwarza ten materiał. Tworzy bibliotekę. Jest to indeks, który pozwala wyszukiwarce zwrócić odpowiednie wyniki, gdy użytkownik wprowadzi zapytanie. Brak robota – brak danych. Bez indeksatora – bez wyszukiwania.

Dlaczego roboty indeksujące nazywane są pająkami?

Nazwa jest dosłowna. Pająki pełzają. Śledzą wątki. Roboty indeksujące śledzą hiperłącza podobnie jak pająk podążający za pasmami sieci. To stara analogia, ale nadal aktualna. Poruszają się od węzła do węzła, zbierając po drodze dane.

Internet to labirynt. Pająki to szczury. A wyszukiwarka jest strażnikiem labiryntu. Chcesz po prostu znaleźć wyjście.