Как поисковые роботы обходят и индексируют веб

12

Поисковые системы не находят результаты волшебным образом. Они используют ботов. Конкретнее, они используют так называемые поисковые роботы (spiders) или веб-краулеры. Эти автоматизированные программы сканируют интернет, чтобы создать базу данных всех сайтов и страниц, которые они могут найти. Без них нет индекса. А без индекса поисковая система не может показать ничего, когда вы вводите запрос.

Этот процесс механический. Роботы формируют очереди URL-адресов для посещения. Когда робот попадает на конкретный сайт, он смотрит не только на главную страницу. Он читает текст. Он анализирует код. Он проверяет мета-теги — специфические, отформатированные ключевые слова, предназначенные для чтения машинами, а не людьми. Он выстраивает карту гиперссылок. Все эти данные формируют профиль, который отправляется обратно в поисковую систему.

Вот механическая реальность: робот следует по ссылкам со страницы на страницу. Вот почему обратные ссылки (backlinks) имеют значение. Если на ваш сайт есть ссылки из других мест, роботы находят вас быстрее. Если у вас нет ссылок, вы фактически невидимы для очереди.

Четыре режима обхода

Роботы не просто блуждают случайно. Они работают в различных режимах, чтобы управлять огромным масштабом интернета.

  1. Режим выбора (Selection Mode)
    Один тип робота отвечает за первоначальный обход. Он определяет приоритетность страниц для посещения и проверяет, не была ли предыдущая версия страницы уже загружена. Он строит первоначальную карту.

  2. Режим повторного посещения (Re-visitation Mode)
    Страницы не остаются статичными. Этот режим нацелен на страницы, которые уже были проиндексированы. Он проверяет наличие обновлений. Если контент изменился, индекс должен это отразить.

  3. Режим вежливости (Politeness Mode)
    У серверов есть ограничения. Если робот слишком сильно «нагружает» сайт, он может его «уронить» или замедлить работу для реальных пользователей. Чтобы предотвратить это, некоторые поисковые системы используют «вежливость». Она ограничивает частоту возвращения робота на одну и ту же страницу, обеспечивая, чтобы серверы не были перегружены.

  4. Режим параллелизации (Parallelization Mode)
    Интернет слишком велик для одного бота. Параллелизация позволяет роботам координировать свои действия. Если несколько роботов обходят одну и ту же страницу, этот режим помогает им обмениваться данными и избегать ненужного дублирования работы.

Роботы против индексаторов: двухэтапный процесс

Часто возникает путаница между краулером (обходчиком) и индексатором. Это разные инструменты.

Робот — это компьютерная программа, которая автоматически собирает или «обходит» информацию в интернете. Индексатор поисковой системы — это программа, которая читает информацию, собранную роботом, и создает на ее основе индекс.

Робот выходит в сеть. Он собирает сырой материал. Индексатор остается на месте. Он обрабатывает этот материал. Он создает библиотеку. Именно индекс позволяет поисковой системе выдавать релевантные результаты, когда пользователь вводит запрос. Нет робота — нет данных. Нет индексатора — нет поиска.

Почему веб-краулеров называют пауками?

Название буквальное. Пауки ползают. Они следуют по нитям. Веб-краулеры следуют по гиперссылкам, подобно тому как паук следует по нитям паутины. Это старая аналогия, но она остается актуальной. Они перемещаются от узла к узлу, собирая данные по ходу дела.

Интернет — это лабиринт. Пауки — это крысы. А поисковая система — хранитель лабиринта. Вы просто хотите найти выход.