Hoe zoekmachinespinnen het internet doorzoeken en indexeren

11

Zoekmachines vinden geen resultaten op magische wijze. Ze gebruiken bots. Ze gebruiken met name wat gewoonlijk zoekmachine-spiders of webcrawlers worden genoemd. Deze geautomatiseerde programma’s struinen het internet af om een ​​database op te bouwen van elke site en pagina die ze kunnen vinden. Zonder hen is er geen index. En zonder index heeft een zoekmachine niets te tonen wanneer u een zoekopdracht typt.

Het proces is mechanisch. Spiders bouwen wachtrijen met URL’s die ze moeten bezoeken. Wanneer iemand op een specifieke site terechtkomt, wordt er niet alleen naar de hoofdpagina gekeken. Het leest de tekst. Het parseert de code. Het inspecteert metatags: die specifieke, opgemaakte trefwoorden die zijn ontworpen om door machines, en niet door mensen, te worden gelezen. Het brengt hyperlinks in kaart. Al deze gegevens vormen een profiel dat teruggestuurd wordt naar de zoekmachine.

Hier is de mechanische realiteit: een spin volgt links van pagina naar pagina. Dit is de reden waarom backlinks belangrijk zijn. Als er vanuit andere plaatsen naar uw site wordt gelinkt, vinden de spiders u sneller. Als u geen koppelingen heeft, bent u feitelijk onzichtbaar voor de wachtrij.

De vier manieren van kruipen

Spinnen dwalen niet zomaar rond. Ze werken in verschillende modi om de enorme schaal van het internet te beheren.

  1. Selectiemodus
    Eén type spin verzorgt de eerste sweep. Het geeft prioriteit aan welke pagina’s moeten worden bezocht en controleert of er al een eerdere versie van een pagina is gedownload. Het bouwt de initiële kaart.

  2. Herbezoekmodus
    Pagina’s blijven niet statisch. Deze modus target pagina’s die al zijn gecrawld. Er wordt gecontroleerd op updates. Als de inhoud is verschoven, moet de index dat weerspiegelen.

  3. Beleefdheidsmodus
    Servers hebben limieten. Als een spin te hard op een website hamert, kan deze crashen of vertragen voor echte gebruikers. Om dit te voorkomen, gebruiken sommige motoren ‘beleefdheid’. Het beperkt hoe vaak een spider terugkeert naar dezelfde pagina, zodat servers niet overweldigd worden.

  4. Parallisatiemodus
    Het web is te groot voor één bot. Door parallellisatie kunnen spinnen coördineren. Als meerdere spiders dezelfde pagina crawlen, helpt deze modus hen gegevens te delen en onnodig dubbel werk te voorkomen.

Spiders versus indexeerders: het tweestapsproces

Er ontstaat vaak verwarring tussen de crawler en de indexer. Het zijn verschillende hulpmiddelen.

Een spider is een computerprogramma dat automatisch informatie van internet verzamelt of ‘crawlt’. De indexer van een zoekmachine is een programma dat de informatie van de spider leest en op basis daarvan een index maakt.

De spin gaat naar buiten. Het pakt de grondstof. De indexeerder leunt achterover. Het verwerkt dat materiaal. Het bouwt de bibliotheek. Dankzij de index kan de zoekmachine relevante resultaten leveren wanneer een gebruiker een zoekopdracht typt. Geen spin, geen data. Geen indexer, geen ophalen.

Waarom worden webcrawlers spiders genoemd?

De naam is letterlijk. Spinnen kruipen. Ze volgen draadjes. Webcrawlers volgen hyperlinks zoals een spin strengen op een web volgt. Het is een oude analogie, maar ze houdt stand. Ze verplaatsen zich van knooppunt naar knooppunt en verzamelen gaandeweg gegevens.

Het internet is een doolhof. De spinnen zijn de ratten. En de zoekmachine is de bewaker van het doolhof. Je wilt gewoon de uitgang vinden.