Technisch

AI-crawlers toelaten of blokkeren: de robots.txt-gids voor 2026

Erik van der Veen8 min

Als een AI-model je content niet mag ophalen, kan het je ook niet citeren. De crawlbaarheid van je website is daarmee een harde randvoorwaarde voor GEO — en die regel je grotendeels in één onopvallend bestand: robots.txt. Deze gids legt uit welke AI-crawlers er zijn, welke je bewust wilt toelaten, en welke je desgewenst kunt weren.

De belangrijkste AI-crawlers in 2026

Er is een cruciaal onderscheid tussen crawlers die AI-modellen trainen en crawlers die live antwoorden en zoekresultaten voeden. Blokkeer je de verkeerde, dan sluit je jezelf uit van zichtbaarheid.

  • GPTBot (OpenAI): verzamelt content voor het trainen van ChatGPT-modellen.
  • OAI-SearchBot (OpenAI): voedt de zoek- en browsefuncties van ChatGPT. Blokkeer je deze, dan verdwijn je uit ChatGPT-zoekresultaten.
  • ChatGPT-User (OpenAI): haalt een pagina op omdat een gebruiker er op dat moment naar vraagt. Dit is geen bulk-crawler maar een directe gebruikersactie.
  • ClaudeBot (Anthropic): primair een training-crawler voor Claude.
  • Claude-SearchBot (Anthropic): nieuw sinds mei 2026, gericht op het voeden van zoekfuncties met bronvermelding.
  • Claude-User (Anthropic): het equivalent van ChatGPT-User; opgeroepen door een gebruiker in het gesprek.
  • PerplexityBot (Perplexity): haalt content op voor de antwoorden van Perplexity, inclusief de zichtbare citaties.
  • Perplexity-User (Perplexity): ophalen op verzoek van een gebruiker tijdens een sessie.
  • Google-Extended: een opt-out-token voor het trainen van Gemini-modellen. Belangrijk: dit blokkeren beïnvloedt NIET je gewone Google-indexering of je zichtbaarheid in AI Overviews.
  • Applebot-Extended: idem, maar voor Apple Intelligence.

Drie soorten crawlers, drie verschillende afwegingen

De namen zijn makkelijker te onthouden als je ze in drie categorieën indeelt. Voor elke categorie geldt een andere afweging.

Training-crawlers (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) verzamelen content om modellen mee te trainen. Toelaten betekent dat je kennis in de basiskennis van toekomstige modellen terechtkomt — zichtbaarheid zonder link, en zonder directe vergoeding. Blokkeren is een principiële keuze die je toekomstige vermelding in die basiskennis beperkt.

Zoek- en antwoord-crawlers (OAI-SearchBot, PerplexityBot, Claude-SearchBot) voeden de live zoekfuncties. Dit is de categorie die er voor GEO het meest toe doet: blokkeer je deze, dan verdwijn je uit de antwoorden waarin wél naar je gelinkt wordt. Voor vrijwel elke site die vindbaar wil zijn, is toelaten hier de enige verstandige keuze.

Gebruiker-geïnitieerde ophalers (ChatGPT-User, Claude-User, Perplexity-User) halen één pagina op omdat een specifieke gebruiker daar op dat moment om vraagt. Dit is functioneel vergelijkbaar met iemand die je pagina in zijn browser opent. Blokkeren betekent hier letterlijk dat je een geïnteresseerde bezoeker buitensluit.

De meest gemaakte fout in de praktijk: iemand wil "niet gebruikt worden voor AI-training", blokkeert alles wat naar AI ruikt, en sluit daarmee ook de zoek-crawlers en de gebruikersophalers uit. Het resultaat is onzichtbaarheid in precies het kanaal dat verkeer oplevert.

De vuistregel: laat zoek-crawlers toe

Voor de meeste websites die vindbaar willen zijn in AI, is het advies simpel: laat de zoek- en antwoord-crawlers toe (OAI-SearchBot, PerplexityBot, Claude-SearchBot, en uiteraard Googlebot). Alleen als je principiële bezwaren hebt tegen het gebruik van je content als trainingsdata, kun je overwegen de zuivere training-crawlers (Google-Extended, Applebot-Extended, eventueel GPTBot) te blokkeren — met de kanttekening dat dat je toekomstige vermelding in de "basiskennis" van modellen kan beperken.

Alle genoemde crawlers respecteren robots.txt. Een expliciete regel per user-agent is dus het stuur dat werkt.

Voorbeeld: een GEO-vriendelijke robots.txt

Een configuratie die AI-zoekmachines binnenlaat, ziet er in de kern zo uit: je staat de zoek-bots expliciet toe (Allow) en verwijst naar je sitemap, zodat crawlers je volledige sitemap kunnen vinden. Zorg dat je geen algemene "Disallow: /" hebt staan die per ongeluk alles blokkeert — een verrassend vaak voorkomende fout die complete websites onzichtbaar maakt voor AI.

Controleer daarnaast of je belangrijkste pagina's niet achter een login, JavaScript-muur of noindex zitten. Semantische HTML en een schone paginastructuur helpen niet alleen bezoekers, maar ook de AI-agents die je site steeds vaker bezoeken.

Vijf fouten die je onzichtbaar maken

In audits kom ik telkens dezelfde problemen tegen. Loop ze even langs:

  • Een achtergebleven "Disallow: /" uit de ontwikkelfase. De klassieker. Een testomgeving die live ging zonder dat iemand het bestand aanpaste. Controleer het letterlijk: open jouwdomein.nl/robots.txt in je browser.
  • Blokkade via de firewall of CDN in plaats van robots.txt. Veel beveiligingslagen blokkeren onbekende user-agents standaard. Je robots.txt kan dan perfect kloppen terwijl de crawler nooit binnenkomt. Controleer je serverlogs op 403-antwoorden richting AI-bots.
  • Een noindex-tag op pagina's die je wél wilt laten citeren. robots.txt regelt of een pagina opgehaald mag worden; noindex regelt of hij mag verschijnen. Beide moeten kloppen.
  • Belangrijke inhoud die pas na een klik of client-side fetch laadt. Wat niet in de HTML staat die de crawler ontvangt, bestaat niet.
  • Een cookiemuur of interstitial voor de content. Wat een bezoeker eerst moet wegklikken, ziet een crawler vaak als de volledige pagina-inhoud.

Die tweede is het meest onderschat. Het is heel goed mogelijk dat je robots.txt keurig alle AI-crawlers toestaat terwijl je beveiligingslaag ze allemaal tegenhoudt. Een blik in je logbestanden is het enige dat daar uitsluitsel over geeft.

Zo controleer je of het werkt

Drie checks die samen een half uur kosten:

  • Open je robots.txt in de browser. Lees hem regel voor regel. Staat er iets dat je niet begrijpt, dan is dat het eerste dat je uitzoekt.
  • Zoek in je serverlogs naar de bot-namen. Filter op GPTBot, PerplexityBot, OAI-SearchBot en Claude-SearchBot en kijk welke statuscodes ze terugkrijgen. Alleen 200-antwoorden betekenen dat ze binnenkomen.
  • Vraag het de AI zelf. Plak de URL van je belangrijkste pagina in Perplexity of ChatGPT met browsing aan en vraag om een samenvatting. Krijg je een correcte samenvatting, dan is de pagina bereikbaar en leesbaar. Krijg je een foutmelding of een gok, dan zit er iets tussen.

Die laatste test is de nuttigste, omdat hij het hele pad test — DNS, firewall, robots.txt, rendering en leesbaarheid — in één keer.

De crawl-to-referral-kloof

Een actueel discussiepunt in 2026 is de zogeheten crawl-to-referral ratio: hoeveel pagina's een AI-crawler ophaalt per bezoeker die het terugstuurt. Cloudflare-data liet zien dat sommige training-crawlers duizenden — soms tienduizenden — pagina's ophalen voor elke doorverwezen bezoeker, terwijl Perplexity relatief veel verkeer teruggeeft. Dit voedt het debat over eerlijke vergoeding voor publishers, en verklaart initiatieven zoals Perplexity's Comet Plus, dat een groot deel van de inkomsten met bronnen deelt.

Voor de meeste bedrijven is dit vooral een interessant debat en geen reden tot actie. De asymmetrie is wrang voor uitgevers die van advertentie-inkomsten leven, maar voor een dienstverlener of webshop is genoemd worden in een AI-antwoord waardevol, ook zonder klik. Weeg dus af vanuit je eigen verdienmodel, niet vanuit dat van de uitgeverswereld.

En llms.txt dan?

Je hebt misschien gehoord van llms.txt — een voorgesteld bestand dat AI-modellen naar je belangrijkste content zou moeten wijzen. Ons advies blijft in 2026 ongewijzigd: besteed er geen prioriteit aan.

  • De adoptie ligt rond 10% van de sites, maar het feitelijke gebruik door crawlers is verwaarloosbaar: in een analyse van ruim 500 miljoen AI-bot-bezoeken raakten slechts enkele honderden het llms.txt-bestand.
  • Google heeft expliciet gezegd het niet te gebruiken en dat ook niet van plan te zijn; John Mueller vergeleek het met de allang afgeschreven keywords-meta-tag.
  • OpenAI's eigen advies is: gebruik robots.txt, niet llms.txt.

Kortom: een correcte robots.txt, een complete sitemap en crawlbare, semantische pagina's leveren echte resultaten. Exotische bestandjes niet.

Aan de slag

Wil je je technische basis op orde brengen? Loop de GEO-checklist door, bekijk de tools om je structured data te valideren, of lees hoe je structured data inzet als de "taal" waarmee je met AI-modellen praat.

Veelgestelde vragen

Welke AI-crawlers moet ik toelaten in robots.txt?

Laat in elk geval de zoek- en antwoord-crawlers toe: OAI-SearchBot (ChatGPT-zoekresultaten), PerplexityBot, Claude-SearchBot en Googlebot. Dit zijn de crawlers die de antwoorden voeden waarin naar je gelinkt wordt. Laat ook de gebruiker-geïnitieerde ophalers toe — ChatGPT-User, Claude-User en Perplexity-User — want die halen een pagina op omdat een concrete bezoeker daarom vraagt. Blokkeren staat gelijk aan een geïnteresseerde bezoeker buitensluiten.

Wat is het verschil tussen GPTBot en OAI-SearchBot?

GPTBot verzamelt content om OpenAI's modellen mee te trainen; OAI-SearchBot voedt de zoek- en browsefuncties van ChatGPT. Blokkeer je GPTBot, dan beperk je hooguit je aanwezigheid in de toekomstige basiskennis van modellen. Blokkeer je OAI-SearchBot, dan verdwijn je uit de ChatGPT-zoekresultaten waarin je juist wél een klikbare bronvermelding kunt krijgen.

Blokkeert Google-Extended mijn zichtbaarheid in AI Overviews?

Nee. Google-Extended is uitsluitend een opt-out voor het trainen van Gemini-modellen. Het blokkeren ervan heeft geen effect op je gewone Google-indexering en evenmin op je zichtbaarheid in AI Overviews, die op de reguliere zoekindex draaien. Dit is een van de meest voorkomende misverstanden bij het instellen van robots.txt.

Waarom komen AI-crawlers niet binnen terwijl mijn robots.txt klopt?

Meestal door een blokkade op een andere laag. Veel firewalls en CDN's weren onbekende user-agents standaard, waardoor een crawler een 403 krijgt voordat robots.txt überhaupt in beeld komt. Controleer je serverlogs op 403-antwoorden richting GPTBot, PerplexityBot en OAI-SearchBot. Andere veelvoorkomende oorzaken: een noindex-tag, content die pas na een klik laadt, of een cookiemuur die de crawler als volledige pagina-inhoud ziet.

Hoe test ik of AI mijn pagina kan lezen?

Plak de URL van je belangrijkste pagina in Perplexity of in ChatGPT met browsing aan en vraag om een samenvatting. Krijg je een correcte samenvatting, dan is de pagina bereikbaar en leesbaar. Krijg je een foutmelding of een duidelijk gegokt antwoord, dan zit er iets tussen. Deze test is de nuttigste die er is, omdat hij het hele pad controleert: DNS, firewall, robots.txt, rendering en leesbaarheid in één keer.

Over de auteur

Erik van der Veen

AI-trainer en consultant. Begeleidt Nederlandse organisaties bij het praktisch inzetten van AI en bij hun vindbaarheid in ChatGPT, Perplexity en Google AI Overviews. Dit artikel is voor het laatst inhoudelijk gecontroleerd op .