WRITGO
Terug naar blog
SEO30 augustus 2026·9 min lezen·door Redactie Writgo

XML sitemap fouten: 1 op de 6 grote NL-sites blokkeert GPTBot voor de sitemap ooit gelezen wordt

In ons eigen onderzoek blokkeert 64 van de 393 bereikbare .nl-topdomeinen GPTBot al in robots.txt, nog voor die crawler één regel van de sitemap kan lezen. De klassieke sitemap-fouten zijn dus niet eens het grootste probleem.

XML sitemap fouten: 1 op de 6 grote NL-sites blokkeert GPTBot voor de sitemap ooit gelezen wordt
Onderdeel van: Alles over AI-vindbaarheid

Xml sitemap fouten draaien in de meeste checklists om syntax, verouderde lastmod-datums en dode links, maar de fout die het meeste schade doet zit ergens anders: in ons eigen onderzoek onder de 500 populairste .nl-domeinen blokkeerde 64 van de 393 bereikbare top-domeinen GPTBot al in robots.txt, nog voor die crawler ook maar één regel uit hun sitemap kon lezen.

Dit artikel behandelt de klassieke sitemap-fouten die elke SEO-checklist noemt, maar ook het gat dat bijna niemand controleert: of je AI-crawler de sitemap überhaupt te zien krijgt. We zijn eerlijk over wat Google wel en niet gebruikt uit je sitemap, en wat dat betekent voor sites die willen meedraaien in AI Overviews.

Belangrijkste punten
  • 64 van de 393 bereikbare .nl-topdomeinen blokkeren GPTBot al in robots.txt, blijkt uit eigen Writgo-onderzoek
  • Google negeert het priority- en changefreq-veld in sitemaps al sinds 2017, bevestigd door John Mueller
  • Noindex-pagina's in je sitemap sturen tegenstrijdige signalen en verspillen crawlbudget
  • 4xx- en 403-pagina's in een sitemap horen bij de vaakst gerapporteerde technische fouten in Ahrefs Site Audit
  • Een sitemap indienen garandeert nooit indexering, alleen dat een pagina makkelijker gevonden kan worden

Wat een xml sitemap eigenlijk moet doen

Een xml sitemap is een lijst van URL's die je aanbiedt aan zoekmachines en crawlers, met als doel dat ze pagina's sneller vinden. Meer doet het bestand technisch niet: het is geen garantie voor indexering, alleen een hulpmiddel bij het ontdekken van pagina's.

Google indexeert een pagina omdat het 'm gevonden heeft én omdat de inhoud goed genoeg wordt bevonden, volgens Techomatic. Een sitemap helpt vooral bij grote sites, webshops en sites met een complexe structuur waar interne links niet alles dekken.

Voor kleinere sites met een logische linkstructuur kan Google pagina's ook prima vinden zonder sitemap, via interne links en externe verwijzingen. Dat betekent niet dat een sitemap overbodig is, maar wel dat de meeste fouten erin minder dramatisch zijn dan vaak wordt beweerd.

Het probleem is dat een sitemap zelden wordt gecontroleerd zodra hij eenmaal draait. Content management systemen genereren het bestand automatisch, en niemand kijkt er meer naar tot Google Search Console een foutmelding toont. Precies daar sluipen de problemen binnen die we hierna bespreken.

De klassieke sitemap-fouten die elke checklist noemt

Drie fouten komen in vrijwel elke technische audit terug. De eerste is een noindex-pagina die toch in de sitemap staat. Je vertelt zoekmachines met een noindex-tag 'laat deze pagina links liggen', maar biedt de URL tegelijk aan als belangrijk genoeg om te crawlen.

Dat is een tegenstrijdig signaal dat leidt tot verspild crawlbudget, volgens SE Ranking: Google crawlt de pagina toch, gehoorzaamt de noindex, en blijft de URL herhaaldelijk bezoeken zonder resultaat.

De tweede klassieker zijn 4xx- en 403-pagina's in de sitemap: URL's die niet meer bestaan of niet toegankelijk zijn, maar nog wel in het bestand staan. Dit hoort bij de vaakst gerapporteerde issues in Ahrefs Site Audit, en het stuurt zoekmachines naar dode einden.

De derde is een lastmod-datum die altijd 'vandaag' toont, ongeacht of de pagina echt is aangepast. Dat maakt het signaal waardeloos: Google gebruikt lastmod juist om te bepalen welke pagina's opnieuw de moeite waard zijn om te crawlen, en een datum die nooit klopt, wordt simpelweg genegeerd.

Deze drie fouten zijn meestal snel op te lossen zodra je ze eenmaal ziet. Het probleem is dat de meeste sitecheckers ze pas signaleren nadat de schade al zichtbaar is in Search Console.

Waarom Google je priority-veld waarschijnlijk nooit heeft gelezen

Veel sitemap-generators laten je per pagina een priority-waarde instellen (van 0.0 tot 1.0) en een changefreq (dagelijks, wekelijks, maandelijks). Bureaus en plugins besteden hier vaak uren aan.

John Mueller van Google bevestigde al in 2017 op Twitter dat Google deze velden negeert, meldt Search Engine Roundtable. Google bepaalt zelf, op basis van waargenomen wijzigingen, hoe vaak een pagina het waard is om opnieuw te crawlen.

De twee velden die er wel toe doen, zijn <loc> (de URL zelf) en <lastmod> (de laatste wijzigingsdatum). Dat laatste veld gebruikt Google actief om te beslissen welke pagina's voorrang krijgen bij herbezoek.

Dit is precies waarom sitemap-optimalisatie soms de verkeerde volgorde heeft: teams polijsten priority-waardes die niemand leest, terwijl een sitemap met dode links of foute noindex-signalen blijft staan. De tijd die in priority-tuning gaat, levert bij Google exact nul resultaat op.

De fout die bijna niemand checkt: AI-crawlers die niet eens binnenkomen

Terwijl iedereen discussieert over priority-velden, ligt er een fundamenteler probleem: GPTBot van OpenAI is de meest geblokkeerde AI-crawler van Nederland. In ons eigen onderzoek onder de 500 populairste .nl-domeinen sluiten 64 van de 393 bereikbare top-domeinen deze crawler expliciet uit in robots.txt.

Dat betekent dat een perfect gevalideerde sitemap, zonder noindex-fouten en met verse lastmod-datums, voor die crawler simpelweg niet bestaat. Robots.txt wordt eerst gelezen, en een disallow-regel stopt GPTBot voordat hij ooit bij de sitemap aankomt.

Voor traditionele Google-indexering maakt dit weinig verschil, want Googlebot en GPTBot zijn losse crawlers met eigen regels. Maar voor zichtbaarheid in AI Overviews en chatbot-antwoorden is het wel relevant: als de crawler achter een AI-assistent je site niet mag lezen, kan die assistent je ook niet citeren.

Sommige GEO-gerichte partijen stellen bovendien dat crawlers als GPTBot en PerplexityBot het priority-veld wél gebruiken als signaal voor opname in trainingsdata, stelt AI SEO. Hard bewezen is dat niet, maar het maakt het des te vreemder dat bedrijven wel tijd steken in priority-tuning en tegelijk hun robots.txt nooit controleren op AI-crawlers.

Tip

Check je robots.txt op regels met 'GPTBot', 'PerplexityBot', 'Google-Extended' of 'ClaudeBot'. Een disallow-regel voor een van deze crawlers betekent dat je sitemap voor die specifieke AI-assistent onzichtbaar is, ongeacht hoe goed het bestand verder is opgebouwd.

GPTBot geblokkeerd bij grote .nl-domeinen · Bron: eigen Writgo-onderzoek onder de 500 populairste .nl-domeinen (2026-06-10)
GPTBot geblokkeerd bij grote .nl-domeinen · Bron: eigen Writgo-onderzoek onder de 500 populairste .nl-domeinen (2026-06-10)

Sitemap-checklist: wat Google wel en niet gebruikt

Onderstaande tabel zet de sitemap-velden naast elkaar met wat Google ermee doet, gebaseerd op de bevestigingen van John Mueller en de gangbare technische documentatie.

Sitemap-onderdeelGebruikt door GoogleRelevant voor AI-crawlers
<loc> (URL)Ja, kernveldJa, kernveld
<lastmod>Ja, stuurt hercrawlprioriteitWaarschijnlijk, signaal voor verse content
<priority>Nee, genegeerd sinds 2017Mogelijk, als indicatie van belang
<changefreq>Nee, Google meet dit zelfOnduidelijk, weinig documentatie
Robots.txt-toegangVoorwaarde om te crawlenVoorwaarde om te crawlen, apart per bot-naam

De conclusie uit deze tabel is ongemakkelijk simpel: de twee velden waar de meeste tijd in gaat zitten (priority en changefreq) doen bij Google helemaal niets, terwijl het veld dat écht bepaalt of een AI-crawler je sitemap ooit ziet (robots.txt) vaak nooit wordt gecontroleerd.

Meer over hoe die crawlers precies werken lees je in onze uitleg over AI-zoekmachines.

Hoe je dit in tien minuten checkt

Je hoeft geen technische tool te kopen om de belangrijkste sitemap-fouten op te sporen. Deze stappen kosten samen ongeveer tien minuten.

  1. Open jouwdomein.nl/sitemap.xml direct in de browser en controleer of het bestand laadt zonder foutmelding.
  2. Open Search Console, ga naar het rapport Sitemaps en kijk of Google 'Kon niet ophalen' meldt, zoals beschreven door Google zelf.
  3. Zoek in je sitemap naar URL's die je weet dat op noindex staan (bijvoorbeeld interne zoekresultaten of dankpagina's) en verwijder ze uit het bestand.
  4. Open jouwdomein.nl/robots.txt en zoek naar 'Disallow' regels bij user-agents als GPTBot, PerplexityBot, Google-Extended of ClaudeBot.
  5. Controleer of de lastmod-datums variëren per pagina, of dat alles dezelfde datum toont (een teken dat het signaal nep is).

Als je wilt weten hoe je site er specifiek voor staat bij AI-assistenten, en niet alleen bij Google, is dat met een handmatige check lastiger te zien. Daarvoor is de gratis AI-vindbaarheidscheck gebouwd: die laat zien of en hoe je al wordt genoemd.

Het Sitemaps-rapport in Google Search Console, waar 'kon niet ophalen'-fouten zichtbaar worden.
Het Sitemaps-rapport in Google Search Console, waar 'kon niet ophalen'-fouten zichtbaar worden. · bron

Wat niet werkt: veelgemaakte misvattingen over sitemap-fouten

De grootste misvatting is dat een sitemap indienen bij Search Console gelijkstaat aan indexering garanderen. Dat is niet zo: een sitemap versnelt ontdekking, maar de inhoud moet nog steeds goed genoeg zijn om opgenomen te worden.

Een tweede misvatting is dat een hoge priority-waarde je pagina's boven concurrenten laat ranken. Zoals eerder besproken negeert Google dit veld al jaren, dus tijd besteden aan het fijnslijpen van priority-getallen levert geen enkel meetbaar effect op.

Een derde misvatting: 'meer URL's in de sitemap is beter'. Een sitemap volgestopt met dunne, dubbele of niet-indexeerbare pagina's verwatert het signaal en kan crawlbudget wegtrekken van de pagina's die er echt toe doen.

Tot slot: veel bedrijven denken dat het blokkeren van een AI-crawler een neutrale, veilige keuze is. Voor een mkb-bedrijf dat klanten wil bereiken via AI Overviews is dat meestal averechts: je sluit jezelf uit van precies de plek waar (potentiële) klanten hun vragen stellen. Voor nieuwsuitgevers met licentieafspraken over content kan die afweging overigens wel anders liggen.

Onze kijk

Wij zien bij klanten vaak dat de aandacht naar de verkeerde plek gaat: uren in priority-waardes die Google al sinds 2017 negeert, terwijl niemand checkt of GPTBot, PerplexityBot of andere AI-crawlers de site überhaupt binnen mogen. Dat laatste bepaalt of je in AI Overviews en chatbot-antwoorden kunt verschijnen, het eerste bepaalt helemaal niets.

ChatGPT is in dit verhaal maar één voorbeeld uit een rijtje AI-assistenten. Wie zijn sitemap- en robots.txt-strategie alleen op die ene chatbot afstemt, bouwt op zand: Gemini, Perplexity en andere assistenten hebben eigen crawlers met eigen regels.

We publiceren hier alleen cijfers die we zelf hebben gemeten, zoals het aandeel .nl-domeinen dat GPTBot blokkeert. Backlinks en autoriteit blijven ondertussen de echte rem op groei in Google; een technisch perfecte sitemap compenseert geen zwakke contentbasis. AI-vindbaarheid is de laag erbovenop, niet de vervanging.

Bronnen

Wat is de meest voorkomende xml sitemap fout?

De meest gerapporteerde fouten zijn noindex-pagina's die toch in de sitemap staan en URL's die een 4xx- of 403-foutcode teruggeven. Beide sturen tegenstrijdige signalen naar zoekmachines en verspillen crawlbudget.

Gebruikt Google het priority-veld in een sitemap?

Nee, John Mueller van Google bevestigde in 2017 dat priority en changefreq worden genegeerd. Google bepaalt zelf, op basis van waargenomen wijzigingen, hoe vaak een pagina opnieuw gecrawld wordt.

Garandeert een xml sitemap dat mijn pagina's geïndexeerd worden?

Nee, een sitemap helpt alleen bij het vinden van pagina's, niet bij het indexeren ervan. Indexering hangt af van contentkwaliteit en relevantie, niet van het aanbieden van de URL.

Blokkeert mijn site AI-crawlers zoals GPTBot zonder dat ik het weet?

Mogelijk wel: in ons onderzoek blokkeerde 64 van de 393 bereikbare grote .nl-domeinen GPTBot in robots.txt. Check je eigen robots.txt op disallow-regels bij GPTBot, PerplexityBot of Google-Extended om het zeker te weten.

Moet ik noindex-pagina's uit mijn sitemap verwijderen?

Ja, een pagina hoort niet in beide lijsten te staan. Kies één intentie: haal de pagina uit de sitemap, of verwijder de noindex-instructie als de pagina toch geïndexeerd moet worden.

Hoe zie ik of mijn site al wordt genoemd door AI-assistenten?

Dat zie je niet in Google Search Console, want die meet alleen klassieke zoekresultaten. Een aparte check op AI-citaties laat zien of en hoe vaak je al wordt genoemd in antwoorden van AI-assistenten.

Begin bij wat je nu al mist

De snelste eerste stap is niet je sitemap herschrijven, maar checken of je robots.txt een AI-crawler blokkeert die je nooit bewust hebt uitgesloten. Dat kost twee minuten en voorkomt dat al het andere werk voor niets is.

Wil je weten hoe je site er specifiek voor AI-assistenten voorstaat, los van klassieke Google-rankings? Doe de gratis AI-vindbaarheidscheck. Voor wie structureel aan de slag wil met sitemaps, robots.txt en de rest van de technische basis, helpt de toolkit je stap voor stap verder.

Gratis AI-vindbaarheidscheck

Benieuwd of jouw eigen site genoemd wordt door Google AI en ChatGPT? Doe de gratis check, je ziet direct wat er mist.

Doe de gratis check
xml sitemaptechnische seoAI-vindbaarheidrobots.txtcrawlbudget
RW
Redactie Writgo

De redactie van Writgo controleert publicaties op basis van eigen data en vermelde bronnen.

Van inzicht naar uitvoering

Wil je dit toepassen op je eigen site?

Stuur je website mee, dan kijkt Mike welke SEO-, AI-vindbaarheids- en conversiepunten als eerste aanvragen kunnen opleveren.