Os mecanismos de pesquisa não encontram resultados por mágica. Eles usam bots. Especificamente, eles usam o que é comumente chamado de spiders de mecanismo de pesquisa ou rastreadores da web. Esses programas automatizados vasculham a Internet para construir um banco de dados de cada site e página que encontram. Sem eles, não há índice. E sem um índice, um mecanismo de busca não tem nada para mostrar quando você digita uma consulta.
O processo é mecânico. Os spiders criam filas de URLs para visitar. Quando alguém acessa um site específico, não olha apenas a página principal. Ele lê o texto. Ele analisa o código. Ele inspeciona metatags – aquelas palavras-chave específicas e formatadas projetadas para serem lidas por máquinas, não por humanos. Ele mapeia hiperlinks. Todos esses dados formam um perfil enviado de volta ao mecanismo de busca.
Aqui está a realidade mecânica: uma aranha segue links de uma página para outra. É por isso que os backlinks são importantes. Se o seu site tiver links de outros lugares, os spiders encontrarão você mais rapidamente. Se você não tiver links, ficará efetivamente invisível para a fila.
Os quatro modos de rastreamento
As aranhas não vagam aleatoriamente. Eles operam em modos distintos para gerenciar a enorme escala da web.
-
Modo de seleção
Um tipo de aranha lida com a varredura inicial. Ele prioriza quais páginas visitar e verifica se uma versão anterior de uma página já foi baixada. Ele constrói o mapa inicial. -
Modo de nova visita
As páginas não ficam estáticas. Este modo tem como alvo páginas que já foram rastreadas. Ele verifica se há atualizações. Se o conteúdo mudou, o índice precisa refletir isso. -
Modo de Polidez
Servidores têm limites. Se um spider martelar um site com muita força, ele pode travá-lo ou torná-lo lento para usuários reais. Para evitar isso, alguns motores usam “educação”. Limita a frequência com que um spider retorna à mesma página, garantindo que os servidores não fiquem sobrecarregados. -
Modo de paralelização
A web é grande demais para um bot. A paralelização permite que os spiders se coordenem. Se vários spiders estiverem rastreando a mesma página, esse modo os ajudará a compartilhar dados e evitar a duplicação de trabalho desnecessariamente.
Spiders vs. Indexadores: o processo de duas etapas
Muitas vezes surge confusão entre o rastreador e o indexador. São ferramentas diferentes.
Um spider é um programa de computador que coleta ou “rastreia” automaticamente informações da Internet. O indexador de um mecanismo de busca é um programa que lê as informações do spider e cria um índice com base nelas.
A aranha sai. Ele pega a matéria-prima. O indexador recosta-se. Ele processa esse material. Ele constrói a biblioteca. O índice é o que permite ao mecanismo de busca fornecer resultados relevantes quando um usuário digita uma consulta. Sem aranha, sem dados. Sem indexador, sem recuperação.
Por que os rastreadores da web são chamados de spiders?
O nome é literal. Aranhas rastejam. Eles seguem tópicos. Os rastreadores da web seguem hiperlinks como uma aranha segue os fios de uma teia. É uma analogia antiga, mas se mantém. Eles se movem de nó em nó, coletando dados à medida que avançam.
A internet é um labirinto. As aranhas são os ratos. E o mecanismo de busca é o guardião do labirinto. Você só quer encontrar a saída.




























