AI-crawlers toelaten of blokkeren: de robots.txt-gids voor 2026
Als een AI-model je content niet mag ophalen, kan het je ook niet citeren. De crawlbaarheid van je website is daarmee een harde randvoorwaarde voor GEO — en die regel je grotendeels in één onopvallend bestand: robots.txt. Deze gids legt uit welke AI-crawlers er zijn, welke je bewust wilt toelaten, en welke je desgewenst kunt weren.
De belangrijkste AI-crawlers in 2026
Er is een cruciaal onderscheid tussen crawlers die AI-modellen trainen en crawlers die live antwoorden en zoekresultaten voeden. Blokkeer je de verkeerde, dan sluit je jezelf uit van zichtbaarheid.
- GPTBot (OpenAI): verzamelt content voor het trainen van ChatGPT-modellen.
- OAI-SearchBot (OpenAI): voedt de zoek- en browsefuncties van ChatGPT. Blokkeer je deze, dan verdwijn je uit ChatGPT-zoekresultaten.
- ClaudeBot (Anthropic): primair een training-crawler voor Claude.
- Claude-SearchBot (Anthropic): nieuw sinds mei 2026, gericht op het voeden van zoekfuncties met bronvermelding.
- PerplexityBot (Perplexity): haalt content op voor de antwoorden van Perplexity, inclusief de zichtbare citaties.
- Google-Extended: een opt-out-token voor het trainen van Gemini-modellen. Belangrijk: dit blokkeren beïnvloedt NIET je gewone Google-indexering of je zichtbaarheid in AI Overviews.
- Applebot-Extended: idem, maar voor Apple Intelligence.
De vuistregel: laat zoek-crawlers toe
Voor de meeste websites die vindbaar willen zijn in AI, is het advies simpel: laat de zoek- en antwoord-crawlers toe (OAI-SearchBot, PerplexityBot, Claude-SearchBot, en uiteraard Googlebot). Alleen als je principiële bezwaren hebt tegen het gebruik van je content als trainingsdata, kun je overwegen de zuivere training-crawlers (Google-Extended, Applebot-Extended, eventueel GPTBot) te blokkeren — met de kanttekening dat dat je toekomstige vermelding in de "basiskennis" van modellen kan beperken.
Alle genoemde crawlers respecteren robots.txt. Een expliciete regel per user-agent is dus het stuur dat werkt.
Voorbeeld: een GEO-vriendelijke robots.txt
Een configuratie die AI-zoekmachines binnenlaat, ziet er in de kern zo uit: je staat de zoek-bots expliciet toe (Allow) en verwijst naar je sitemap, zodat crawlers je volledige sitemap kunnen vinden. Zorg dat je geen algemene "Disallow: /" hebt staan die per ongeluk alles blokkeert — een verrassend vaak voorkomende fout die complete websites onzichtbaar maakt voor AI.
Controleer daarnaast of je belangrijkste pagina's niet achter een login, JavaScript-muur of noindex zitten. Semantische HTML en een schone paginastructuur helpen niet alleen bezoekers, maar ook de AI-agents die je site steeds vaker bezoeken.
De crawl-to-referral-kloof
Een actueel discussiepunt in 2026 is de zogeheten crawl-to-referral ratio: hoeveel pagina's een AI-crawler ophaalt per bezoeker die het terugstuurt. Cloudflare-data liet zien dat sommige training-crawlers duizenden — soms tienduizenden — pagina's ophalen voor elke doorverwezen bezoeker, terwijl Perplexity relatief veel verkeer teruggeeft. Dit voedt het debat over eerlijke vergoeding voor publishers, en verklaart initiatieven zoals Perplexity's Comet Plus, dat een groot deel van de inkomsten met bronnen deelt.
En llms.txt dan?
Je hebt misschien gehoord van llms.txt — een voorgesteld bestand dat AI-modellen naar je belangrijkste content zou moeten wijzen. Ons advies blijft in 2026 ongewijzigd: besteed er geen prioriteit aan.
- De adoptie ligt rond 10% van de sites, maar het feitelijke gebruik door crawlers is verwaarloosbaar: in een analyse van ruim 500 miljoen AI-bot-bezoeken raakten slechts enkele honderden het llms.txt-bestand.
- Google heeft expliciet gezegd het niet te gebruiken en dat ook niet van plan te zijn; John Mueller vergeleek het met de allang afgeschreven keywords-meta-tag.
- OpenAI's eigen advies is: gebruik robots.txt, niet llms.txt.
Kortom: een correcte robots.txt, een complete sitemap en crawlbare, semantische pagina's leveren echte resultaten. Exotische bestandjes niet.
Aan de slag
Wil je je technische basis op orde brengen? Loop de GEO-checklist door, bekijk de tools om je structured data te valideren, of lees hoe je structured data inzet als de "taal" waarmee je met AI-modellen praat.