Het internet bestaat uit oneindig veel pagina’s, zoveel pagina’s dat het onmogelijk is voor zoekmachines als Google om alle pagina’s na te lopen. Om ervoor te zorgen dat de zoekmachines toch zo veel mogelijk websites kunnen indexeren, stellen zoekmachines een limiet aan het aantal pagina’s dat ze per website crawlen. Dit wordt ook wel het crawl budget genoemd.

Nu ontstaat er alleen een probleem: veel websites beschikt over een groot aantal pagina’s dat niet heel relevant is voor de zoekmachines. Denk hierbij aan pagina duplicaten of pagina’s met weinig inhoud. Zoekmachines kunnen niet weten of een pagina relevant is totdat ze de pagina hebben gecrawld. Dit betekent dat grote delen van het crawl budget van een website opgemaakt worden aan pagina’s die uiteindelijk niet geïndexeerd worden. Dit is zonde, maar gelukkig is hier een oplossing voor: crawl optimalisatie. In dit artikel leggen we uit hoe je dit doet.

Welke pagina’s moeten we aanpakken?

Crawl optimalisatie valt onder technische SEO. We nemen eerst even een stapje terug en leggen uit wanneer een crawl optimalisatie nodig is, welke pagina’s we precies aanpakken én hoe deze pagina’s ontstaan. We raden aan om pas naar je crawl budget te kijken wanneer je website uit meer dan 10.000 pagina’s bestaat. Heeft je website minder pagina’s? Dan is het niet nodig om je hier druk om te maken, al kan het toch interessant zijn om eens te kijken of er geen quick wins zijn. Al helemaal als je verwacht nog verder te groeien. Soms kunnen websites toch aanzienlijk meer pagina’s hebben dan je denkt, in de meeste gevallen komt dit door technische problemen. Om die reden raden we zelfs bij kleinere websites te controleren uit hoeveel pagina’s de website bestaat.

Duplicate content

De meest voorkomende soort probleem pagina’s zijn duplicaten van andere pagina’s, ook wel “duplicate content” genoemd. Deze pagina’s zijn vaak directe kopieën van andere pagina’s op de website. Om technische redenen willen websites nog wel eens dezelfde pagina meermaals weergeven op verschillende URL’s.

Denk bijvoorbeeld aan een productpagina die op zowel /shop/product-pagina/ beschikbaar is als op /categorie/product-pagina/. De ene versie ontstaat wanneer je naar het product gaat vanuit de volledige productcatalogus, de ander wanneer je naar het product gaat vanuit een categorie. Het CMS heeft vast een goede reden om het zo te implementeren, maar Google wordt er niet bepaald blij van.

Duplicate content ontstaat ook snel bij e-commerce websites die veel met productfilters werken op overzichtspagina’s. Veel e-commerce systemen voegen elke optie die je instelt in de filters toe aan de URL van de pagina. Zoekmachines zien alle verschillende filtercombinaties als een losse pagina, terwijl het eigenlijk steeds dezelfde pagina is, maar met een paar producten meer of minder zichtbaar. Zo zorgen een paar filters op een handjevol productcategorieën al gauw voor honderdenduizenden crawlbare URL’s.

Duplicate content kan ook een probleem vormen voor je prestaties in Google. Überhaupt geen overbodige luxe dus om te controleren of er sprake is van duplicate content.

Thin content

Nog een veel voorkomend probleem voor je crawl budget zijn pagina’s met weinig tot geen inhoud. Dit noemen we ook wel thin content. Neem bijvoorbeeld een portfolio pagina die voor ieder project een losse pagina aanmaakt, op iedere pagina wordt in dat geval alleen een afbeelding weergegeven. Niet heel nuttig, en ook nog eens slecht voor je crawl budget.

Hoe ontdek je problemen voor je crawl budget?

Google Search Console

Gelukkig heeft Google een handige tool voor het vinden van probleem pagina’s, namelijk Google Search Console! Search Console is een systeem dat je veel inzicht kan geven in je website vanuit het perspectief van Google. Het systeem beschikt over verschillende overzichten waarin je kan zien welke pagina’s worden geïndexeerd, en welke niet.

Bij het tabblad ‘Pagina’s’ zie je direct hoeveel pagina’s wel en niet geïndexeerd worden. Als je verder gaat dan zie je een overzicht met alle redenen waarom pagina’s niet geïndexeerd worden, en kun je doorklikken om te zien welke pagina’s het precies om gaat.

We raden aan om eens goed door deze lijsten met pagina’s heen te kijken om te zien of je ergens pagina’s ziet die niet zouden moeten bestaan, of niet geïndexeerd hoeven te worden. Het beste is als je een patroon hierin kan vinden, bijvoorbeeld een grote hoeveelheid pagina’s die allemaal dezelfde parameters in de URL hebben staan. Als dit pagina’s zijn die niet geïndexeerd hoeven te worden, dan heb je een aandachtspunt gevonden.

Diepere weergave

Search Console biedt ook een diepere weergave, namelijk de Crawlstatistieken, te vinden bij Instellingen. Hier kun je per reactiecode en bestandstype, doel, én Googlebot zien wat er gecrawled wordt, en wanneer. Bij deze lijsten kun je vaak nog meer vinden dan bij het tabblad Pagina’s.

Let wel op: Hier staan crawlstatistieken van alle Googlebots in, dus niet alleen van Google Search maar ook van Google Ads. Kijk dus goed uit met het optimaliseren van pagina’s die je hier vindt zodat je geen problemen veroorzaakt bij andere Google systemen.

De crawlstatistieken kunnen overigens ook andere inzichten geven, zo kun je bijvoorbeeld goed zien wanneer wij een nieuwe versie van onze website live hebben gezet die beter geoptimaliseerd is voor pagespeed. Doei Javascript!

Screaming Frog

Een andere tool die je kan gebruiken voor inzichten voor je crawl budget is Screaming Frog, dit is een lokale website crawler waarmee je net als Google je website kan crawlen. Zo heb je snel een compleet overzicht van alle pagina’s op je website, en kun je zien wat Google vindt op je website. Perfect voor websites die nog niet live staan, zoals de staging versie van je nieuwe webshop. Op deze manier kun je crawl problemen zien voordat de websites live gaan én eventuele problemen direct voorkomen.

Onnodige pagina’s verhelpen

Nu je alle problemen hebt gevonden is de volgende stap natuurlijk het oplossen van de problemen, maar hoe? De manier verschilt helaas per website, CMS, en het soort probleem. Gelukkig is er één oplossing die de meeste problemen verhelpt: de pagina’s uitsluiten!

Het uitsluiten van pagina’s doe je door regels in te stellen in de robots.txt van je website. Door hier ‘Disallow’ regels toe te voegen geef je aan de crawlers door bij welke URL reeksen de crawlers niet mogen komen. Zo blokkeer je in één keer een deel van je website voor Google en neem je dus een boel pagina’s weg die je crawl budget kunnen opslokken. Hoe je een robots.txt precies opzet gaat te ver voor dit artikel, maar Google legt zelf gelukkig goed uit hoe je robots.txt opzet.

Is het niet mogelijk om een goede uitsluiting op te zetten, bijvoorbeeld omdat er geen simpel patroon in de probleem pagina’s zit? Dan raden we aan om te kijken of je het onderliggende probleem op kan lossen, of de structuur zo aan te passen dat er wel een uitsluitbaar patroon in zit.

Een andere oplossing is het verwijderen van verwijzingen naar deze pagina’s in je website. Dit zorgt ervoor dat Google ze niet tegenkomt tijdens het crawlen, en dus niet weet dat ze bestaan. Dit werkt overigens alleen goed als je probleem pagina’s nog niet in Search Console hebt gezien. Zodra Google een pagina eenmaal gezien heeft wordt deze gecrawld, zelfs al staat deze verder niet meer op de website.

Crawl budget verder optimaliseren

Nu kan het natuurlijk zo zijn dat je een website hebt met duizenden producten die eigenlijk allemaal geïndexeerd moeten worden. Je hebt verder geen of weinig duplicate en thin content. Toch worden enkele pagina’s maar niet geïndexeerd omdat Google alle tijd al kwijt is aan het crawlen van andere pagina’s.

Ook voor dit probleem zijn genoeg oplossingen. Het limiet dat zoekmachines stellen is namelijk gebaseerd op tijd, niet op een specifieke hoeveelheid pagina’s. Bij een website die 1 seconde doet over het laden van een pagina crawlt Google meer dan bij een website die 5 seconden doet over het laden. Dit betekent dus dat je je crawl budget kan verhogen door de paginasnelheid van je website te verbeteren. Ook verbeter je hier natuurlijk de gebruikerservaring mee, een win-win situatie dus!

Je kunt ook aandacht besteden aan sitemaps. Dit zijn lijsten met alle pagina’s op je website die Google gebruikt om snel te zien wat er allemaal aanwezig is op je website. Door hier alleen de pagina’s in te zetten die je daadwerkelijk geïndexeerd wil hebben zorg je er ook weer voor dat Google minder tijd steekt in pagina’s die je niet geïndexeerd wil hebben. Als je een website hebt met pagina’s die veel veranderen kun je hier ook in zetten wanneer de pagina voor het laatst is veranderd. Zo weet Google direct of een pagina is veranderd sinds de laatste crawl en hoeft de zoekmachine minder tijd te steken in pagina’s die niet zijn veranderd.

Duurzaamheid

Een crawloptimalisatie draagt ook bij aan de duurzaamheid van je website. Deze optimalisatie is iets waar we misschien niet snel aan denken, maar het werkt vrij simpel. Elke pagina die gecrawled wordt kost denkvermogen van zowel de server van de zoekmachine als van de server van je website. En denkvermogen staat gelijk aan stroom, wat weer gelijk staat aan uitstoot en harde euro’s aan hostingkosten. Dus voor iedere pagina die je uitsluit bespaar je een beetje stroom. Dit is niet alleen goed voor het milieu, maar ook voor je eigen portemonnee!

Meer weten over een crawloptimalisatie?

Heb je het artikel gelezen en kom je ergens toch niet uit, of zie je door alle data het bos niet meer? Neem dan eens contact op, en kijk wat wij voor je kunnen betekenen. Onze adviseurs vertellen tijdens een adviesgesprek graag wat we voor je kunnen betekenen. Waar kan je onze hulp bij gebruiken?

Geschreven door

Benieuwd wat online marketing voor jou kan betekenen?
Neem dan gerust contact op

Onwise beeldmerk
Onwise - We are On it Onwise - We are On it