← Terug naar blog

GPTBot blokkeren haalt je niet uit ChatGPT

12 augustus 2026 · 8 minuten lezen

Er staat online nogal eens hetzelfde advies: blokkeer geen GPTBot in je robots.txt, want dan verdwijn je uit ChatGPT.

Dat klopt niet.

Stel: een ondernemer wil niet dat zijn teksten worden gebruikt om AI-modellen mee te trainen. Hij zoekt op hoe dat moet, vindt het advies "blokkeer GPTBot" en zet die regel in zijn robots.txt. Twee weken later kijkt hij of zijn bedrijf ergens opduikt in ChatGPT en ziet niets. De conclusie ligt voor de hand: dat komt door die blokkade.

Alleen: die twee dingen hebben niet dezelfde functie.

GPTBot blokkeren zorgt er niet voor dat je uit ChatGPT Search verdwijnt. OpenAI gebruikt daar een andere crawler voor: OAI-SearchBot. GPTBot wordt gebruikt voor het verzamelen van content die kan worden gebruikt om generatieve AI-modellen te verbeteren.

Dat verschil is belangrijk. Je kunt dus zeggen: mijn teksten niet gebruiken voor training, terwijl je website wel toegankelijk blijft voor ChatGPT Search.

Eerst even: wat doet robots.txt?

Op vrijwel iedere website staat een bestand op jouwdomein.nl/robots.txt. Daarin geef je aan welke geautomatiseerde bezoekers delen van je website wel of niet mogen crawlen.

Zie het niet als een slot op de deur, maar als een bordje bij de ingang. Een crawler die zich aan de regels houdt, leest het bestand en respecteert wat daarin staat. Technisch houdt robots.txt niemand tegen die besluit het bordje te negeren.

Dat onderscheid wordt belangrijk zodra we naar AI-crawlers kijken.

Er bestaat niet één AI-bot

Hier gaat het in veel adviezen mis. OpenAI heeft niet één bot die alles doet. Anthropic ook niet. Verschillende bots hebben verschillende taken.

* Google-Extended is technisch geen aparte crawler zoals GPTBot. Het is een robots.txt-token waarmee je bepaalt hoe content die Google crawlt gebruikt mag worden voor bepaalde Gemini-systemen.
OpenAIAnthropicGooglePerplexity
TrainingVerzamelt content om AI-modellen mee te trainen of verbeterenGPTBotClaudeBotGoogle-Extended*n.v.t.
Zoeken en indexerenBouwt de index waaruit geciteerd wordt bij een zoekopdrachtOAI-SearchBotClaude-SearchBotGooglebotPerplexityBot
Pagina ophalenHaalt één pagina op als een gebruiker daar op dat moment om vraagtChatGPT-UserClaude-Usern.v.t.Perplexity-User

Drie verschillende taken. Ze allemaal AI-bot noemen en vervolgens één algemeen advies geven, is precies waar de verwarring begint.

Wat kost het blokkeren van een AI-bot je werkelijk?

Dat hangt volledig af van welke bot je blokkeert.

Trainingsbots blokkeren

Je teksten worden niet gebruikt om AI-modellen mee te trainen.

Geen effect op je vindbaarheid in zoekresultaten.

Zoekbots blokkeren

Je site kan niet worden opgehaald voor AI-zoekmachines.

Je verdwijnt uit die resultaten, omdat er niets is om uit te putten.

Kort samengevat

Training en zoeken zijn twee verschillende dingen. Blokkeer je de verkeerde bot, dan bereik je het tegenovergestelde van wat je wilde.

Trainingsbots

Blokkeer je GPTBot, dan geef je OpenAI aan dat GPTBot je website niet mag crawlen voor het verbeteren van generatieve AI-modellen. Daarmee blokkeer je OAI-SearchBot niet. Je website kan dus toegankelijk blijven voor ChatGPT Search terwijl GPTBot buiten blijft.

Dat is geen technisch trucje. OpenAI heeft die functies bewust van elkaar gescheiden.

Zoekbots

Bij zoekbots ligt het anders. Blokkeer je OAI-SearchBot, dan mag OpenAI je website niet via die crawler opnemen voor ChatGPT Search. Daarmee beperk je dus juist je kans om vanuit die zoekfunctionaliteit gevonden te worden.

Niet omdat OpenAI je straft. Je hebt de crawler zelf verteld dat hij niet naar binnen mag.

De robots.txt-valkuil die makkelijk over het hoofd wordt gezien

Er zit nog een technisch detail aan robots.txt dat minstens zo belangrijk is als de keuze welke bot je blokkeert.

Stel dat je dit hebt:

User-agent: *
Disallow: /beheer/

en je voegt vervolgens een apart blok toe:

User-agent: GPTBot
Disallow: /

Voor GPTBot wordt het specifieke blok gebruikt. Ga er dus niet vanuit dat de regels uit User-agent: * automatisch worden opgeteld bij ieder specifiek blok dat je toevoegt.

Heb je in het algemene blok meerdere afspraken staan en maak je daarna een apart blok voor een crawler, dan moet je weten welke regels die crawler daadwerkelijk volgt.

Dus: niet zomaar een paar regels van internet kopiëren, onderaan je robots.txt plakken en ervan uitgaan dat het goed zit.

En Google dan?

Google werkt net even anders.

Google-Extended is een control waarmee je aangeeft of door Google gecrawlde content gebruikt mag worden voor bepaalde Gemini-systemen, waaronder training en bepaalde vormen van grounding.

Het bepaalt niet of je website in Google Search wordt opgenomen en het is geen rankingfactor. Google zegt daar zelf over:

"Google-Extended doesn't affect a site's inclusion in Search, nor do we use Google-Extended as a ranking signal in Search."

Google, documentatie over crawling

Je kunt Google-Extended dus blokkeren zonder daarmee je normale positie in Google Search te verwijderen.

Voor AI Overviews en AI Mode ligt dat anders. Die maken gebruik van Google's bestaande zoekinfrastructuur. Google-Extended blokkeren is daarom geen knop waarmee je jezelf uit Google's AI-zoekfuncties haalt.

Daarvoor kom je uit bij de reguliere controls van Google Search, zoals noindex, nosnippet en max-snippet.

Maar daar hangt wél een prijs aan. Zet je nosnippet in om te voorkomen dat Google tekst uit je pagina als snippet gebruikt, dan verdwijnt ook het tekstfragment onder je gewone zoekresultaat. Je kunt niet één instelling aanzetten die alleen AI Overviews raakt en de rest van je zoekresultaat ongemoeid laat.

Dat is precies waarom je moet weten wat zo'n regel doet voordat je hem overneemt.

Soms is het probleem veel simpeler

Voordat je afzonderlijke AI-crawlers gaat nalopen, kijk eerst naar de basis. Een regel als:

User-agent: *
Disallow: /

vertelt crawlers dat ze je volledige website niet mogen crawlen.

Zo'n regel zie je bijvoorbeeld wanneer een test- of ontwikkelomgeving is afgeschermd en vervolgens live wordt gezet zonder de robots.txt aan te passen.

Dan kun je lang discussiëren over GPTBot, maar heb je een veel groter probleem: je hebt iedereen buitengesloten.

Controleer ook Googlebot en Bingbot. AI-functionaliteiten bouwen voor een deel voort op bestaande zoekmachines en hun indexen. Sluit je die crawlers buiten, dan raakt dat dus meer dan alleen je klassieke zoekresultaten.

Eén vreemde eend in de bijt: Perplexity

Bij robots.txt ga je ervan uit dat de partij aan de andere kant je instructies respecteert. Dat gebeurt niet altijd.

Cloudflare rapporteerde in augustus 2025 dat het bij Perplexity crawlers had waargenomen die websites bleven benaderen nadat de bekende Perplexity-crawler via robots.txt was geblokkeerd. Volgens Cloudflare gebeurde dat onder andere via andere user-agents en infrastructuur.

OpenAI werd in hetzelfde onderzoek juist als goed voorbeeld genoemd: de crawler las robots.txt en stopte wanneer crawling niet was toegestaan.

Dat onderstreept meteen wat robots.txt is: een afspraak, geen beveiliging.

Wat kun je dan in robots.txt zetten?

Stel dat je actuele zoekbots wilt toelaten, maar bepaalde trainingsbots wilt weren. Dan kan de bedoeling er bijvoorbeeld zo uitzien:

# Zoekbots: toegankelijk houden
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

# Trainingsgebruik: afzonderlijke keuze
User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

Toestaan

Deze bots mogen je site crawlen voor zoekfunctionaliteit.

Blokkeren

Deze bots verzamelen content voor het trainen of verbeteren van modellen.

Let op

robots.txt is een afspraak, geen beveiliging. Niet elke partij houdt zich eraan.

Dit is een voorbeeld, geen advies om al deze trainingsbots te blokkeren.

Of je jouw content beschikbaar wilt stellen voor het trainen of verbeteren van AI-modellen is je eigen keuze. Het punt is dat je die keuze bewust maakt en niet per ongeluk ook iets anders blokkeert.

De Allow: /-regels hierboven zijn bovendien niet nodig wanneer er verder geen blokkades bestaan. Zonder een verbod is crawling standaard toegestaan. Ze staan hier vooral om duidelijk te maken wat de bedoeling is.

Heb je al een uitgebreide robots.txt met algemene en specifieke regels? Neem dit voorbeeld dan niet blind over, maar controleer eerst welke regels voor iedere crawler gelden.

Hoe controleer je je eigen website?

Open jouwdomein.nl/robots.txt en kijk naar deze punten.

Staat er Disallow: / onder User-agent: *?

Dan vertel je alle crawlers dat ze je website niet mogen crawlen. Controleer of dat echt de bedoeling is.

Worden Googlebot of Bingbot apart geblokkeerd?

Dan raakt dat niet alleen je gewone vindbaarheid, maar mogelijk ook AI-functionaliteiten die op hun zoekinfrastructuur voortbouwen.

Heb je aparte regels voor GPTBot?

Prima, maar weet wat je ermee blokkeert. GPTBot en OAI-SearchBot doen verschillend werk. GPTBot blokkeren is niet hetzelfde als ChatGPT Search blokkeren.

Heb je meerdere specifieke botblokken?

Controleer welke regels iedere crawler daadwerkelijk volgt. Algemene en specifieke blokken worden niet simpelweg bij elkaar opgeteld.

GPTBot blokkeren? Dat kan dus prima

Wil je niet dat GPTBot je website crawlt voor het verbeteren van OpenAI's generatieve AI-modellen? Dan kun je GPTBot blokkeren.

Dat betekent niet dat je website daarmee automatisch uit ChatGPT Search verdwijnt. Daarvoor moet je naar OAI-SearchBot kijken.

En dat is uiteindelijk de belangrijkste boodschap van dit hele verhaal: praat niet over AI-bots alsof het één ding is. Kijk welke crawler je voor je hebt, wat die doet en beslis daarna pas of je hem wilt toelaten.

Twijfel je of het bij jouw website goed staat?

Stuur me je websiteadres. Ik kijk even naar je robots.txt en vertel je wat er daadwerkelijk wordt toegestaan en geblokkeerd. Duurt vijf minuten en kost niets.

Stuur me je adres