Als een AI-model je content niet mag ophalen, kan het je ook niet citeren. De crawlbaarheid van je website is daarmee een harde randvoorwaarde voor GEO — en die regel je grotendeels in één onopvallend bestand: robots.txt. Deze gids legt uit welke AI-crawlers er zijn, welke je bewust wilt toelaten, en welke je desgewenst kunt weren.
De belangrijkste AI-crawlers in 2026
Er is een cruciaal onderscheid tussen crawlers die AI-modellen trainen en crawlers die live antwoorden en zoekresultaten voeden. Blokkeer je de verkeerde, dan sluit je jezelf uit van zichtbaarheid.
- GPTBot (OpenAI): verzamelt content voor het trainen van ChatGPT-modellen.
- OAI-SearchBot (OpenAI): voedt de zoek- en browsefuncties van ChatGPT. Blokkeer je deze, dan verdwijn je uit ChatGPT-zoekresultaten.
- ChatGPT-User (OpenAI): haalt een pagina op omdat een gebruiker er op dat moment naar vraagt. Dit is geen bulk-crawler maar een directe gebruikersactie.
- ClaudeBot (Anthropic): primair een training-crawler voor Claude.
- Claude-SearchBot (Anthropic): nieuw sinds mei 2026, gericht op het voeden van zoekfuncties met bronvermelding.
- Claude-User (Anthropic): het equivalent van ChatGPT-User; opgeroepen door een gebruiker in het gesprek.
- PerplexityBot (Perplexity): haalt content op voor de antwoorden van Perplexity, inclusief de zichtbare citaties.
- Perplexity-User (Perplexity): ophalen op verzoek van een gebruiker tijdens een sessie.
- Google-Extended: een opt-out-token voor het trainen van Gemini-modellen. Belangrijk: dit blokkeren beïnvloedt NIET je gewone Google-indexering of je zichtbaarheid in AI Overviews.
- Applebot-Extended: idem, maar voor Apple Intelligence.
Drie soorten crawlers, drie verschillende afwegingen
De namen zijn makkelijker te onthouden als je ze in drie categorieën indeelt. Voor elke categorie geldt een andere afweging.
Training-crawlers (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) verzamelen content om modellen mee te trainen. Toelaten betekent dat je kennis in de basiskennis van toekomstige modellen terechtkomt — zichtbaarheid zonder link, en zonder directe vergoeding. Blokkeren is een principiële keuze die je toekomstige vermelding in die basiskennis beperkt.
Zoek- en antwoord-crawlers (OAI-SearchBot, PerplexityBot, Claude-SearchBot) voeden de live zoekfuncties. Dit is de categorie die er voor GEO het meest toe doet: blokkeer je deze, dan verdwijn je uit de antwoorden waarin wél naar je gelinkt wordt. Voor vrijwel elke site die vindbaar wil zijn, is toelaten hier de enige verstandige keuze.
Gebruiker-geïnitieerde ophalers (ChatGPT-User, Claude-User, Perplexity-User) halen één pagina op omdat een specifieke gebruiker daar op dat moment om vraagt. Dit is functioneel vergelijkbaar met iemand die je pagina in zijn browser opent. Blokkeren betekent hier letterlijk dat je een geïnteresseerde bezoeker buitensluit.
De meest gemaakte fout in de praktijk: iemand wil "niet gebruikt worden voor AI-training", blokkeert alles wat naar AI ruikt, en sluit daarmee ook de zoek-crawlers en de gebruikersophalers uit. Het resultaat is onzichtbaarheid in precies het kanaal dat verkeer oplevert.
De vuistregel: laat zoek-crawlers toe
Voor de meeste websites die vindbaar willen zijn in AI, is het advies simpel: laat de zoek- en antwoord-crawlers toe (OAI-SearchBot, PerplexityBot, Claude-SearchBot, en uiteraard Googlebot). Alleen als je principiële bezwaren hebt tegen het gebruik van je content als trainingsdata, kun je overwegen de zuivere training-crawlers (Google-Extended, Applebot-Extended, eventueel GPTBot) te blokkeren — met de kanttekening dat dat je toekomstige vermelding in de "basiskennis" van modellen kan beperken.
Alle genoemde crawlers respecteren robots.txt. Een expliciete regel per user-agent is dus het stuur dat werkt.
Voorbeeld: een GEO-vriendelijke robots.txt
Een configuratie die AI-zoekmachines binnenlaat, ziet er in de kern zo uit: je staat de zoek-bots expliciet toe (Allow) en verwijst naar je sitemap, zodat crawlers je volledige sitemap kunnen vinden. Zorg dat je geen algemene "Disallow: /" hebt staan die per ongeluk alles blokkeert — een verrassend vaak voorkomende fout die complete websites onzichtbaar maakt voor AI.
Controleer daarnaast of je belangrijkste pagina's niet achter een login, JavaScript-muur of noindex zitten. Semantische HTML en een schone paginastructuur helpen niet alleen bezoekers, maar ook de AI-agents die je site steeds vaker bezoeken.
Vijf fouten die je onzichtbaar maken
In audits kom ik telkens dezelfde problemen tegen. Loop ze even langs:
- Een achtergebleven "Disallow: /" uit de ontwikkelfase. De klassieker. Een testomgeving die live ging zonder dat iemand het bestand aanpaste. Controleer het letterlijk: open jouwdomein.nl/robots.txt in je browser.
- Blokkade via de firewall of CDN in plaats van robots.txt. Veel beveiligingslagen blokkeren onbekende user-agents standaard. Je robots.txt kan dan perfect kloppen terwijl de crawler nooit binnenkomt. Controleer je serverlogs op 403-antwoorden richting AI-bots.
- Een noindex-tag op pagina's die je wél wilt laten citeren. robots.txt regelt of een pagina opgehaald mag worden; noindex regelt of hij mag verschijnen. Beide moeten kloppen.
- Belangrijke inhoud die pas na een klik of client-side fetch laadt. Wat niet in de HTML staat die de crawler ontvangt, bestaat niet.
- Een cookiemuur of interstitial voor de content. Wat een bezoeker eerst moet wegklikken, ziet een crawler vaak als de volledige pagina-inhoud.
Die tweede is het meest onderschat. Het is heel goed mogelijk dat je robots.txt keurig alle AI-crawlers toestaat terwijl je beveiligingslaag ze allemaal tegenhoudt. Een blik in je logbestanden is het enige dat daar uitsluitsel over geeft.
Zo controleer je of het werkt
Drie checks die samen een half uur kosten:
- Open je robots.txt in de browser. Lees hem regel voor regel. Staat er iets dat je niet begrijpt, dan is dat het eerste dat je uitzoekt.
- Zoek in je serverlogs naar de bot-namen. Filter op GPTBot, PerplexityBot, OAI-SearchBot en Claude-SearchBot en kijk welke statuscodes ze terugkrijgen. Alleen 200-antwoorden betekenen dat ze binnenkomen.
- Vraag het de AI zelf. Plak de URL van je belangrijkste pagina in Perplexity of ChatGPT met browsing aan en vraag om een samenvatting. Krijg je een correcte samenvatting, dan is de pagina bereikbaar en leesbaar. Krijg je een foutmelding of een gok, dan zit er iets tussen.
Die laatste test is de nuttigste, omdat hij het hele pad test — DNS, firewall, robots.txt, rendering en leesbaarheid — in één keer.
De crawl-to-referral-kloof
Een actueel discussiepunt in 2026 is de zogeheten crawl-to-referral ratio: hoeveel pagina's een AI-crawler ophaalt per bezoeker die het terugstuurt. Cloudflare-data liet zien dat sommige training-crawlers duizenden — soms tienduizenden — pagina's ophalen voor elke doorverwezen bezoeker, terwijl Perplexity relatief veel verkeer teruggeeft. Dit voedt het debat over eerlijke vergoeding voor publishers, en verklaart initiatieven zoals Perplexity's Comet Plus, dat een groot deel van de inkomsten met bronnen deelt.
Voor de meeste bedrijven is dit vooral een interessant debat en geen reden tot actie. De asymmetrie is wrang voor uitgevers die van advertentie-inkomsten leven, maar voor een dienstverlener of webshop is genoemd worden in een AI-antwoord waardevol, ook zonder klik. Weeg dus af vanuit je eigen verdienmodel, niet vanuit dat van de uitgeverswereld.
En llms.txt dan?
Je hebt misschien gehoord van llms.txt — een voorgesteld bestand dat AI-modellen naar je belangrijkste content zou moeten wijzen. Ons advies blijft in 2026 ongewijzigd: besteed er geen prioriteit aan.
- De adoptie ligt rond 10% van de sites, maar het feitelijke gebruik door crawlers is verwaarloosbaar: in een analyse van ruim 500 miljoen AI-bot-bezoeken raakten slechts enkele honderden het llms.txt-bestand.
- Google heeft expliciet gezegd het niet te gebruiken en dat ook niet van plan te zijn; John Mueller vergeleek het met de allang afgeschreven keywords-meta-tag.
- OpenAI's eigen advies is: gebruik robots.txt, niet llms.txt.
Kortom: een correcte robots.txt, een complete sitemap en crawlbare, semantische pagina's leveren echte resultaten. Exotische bestandjes niet.
Aan de slag
Wil je je technische basis op orde brengen? Loop de GEO-checklist door, bekijk de tools om je structured data te valideren, of lees hoe je structured data inzet als de "taal" waarmee je met AI-modellen praat.