AI-crawlers blokkeren: hoe het werkt en of je het moet willen
← Actueel · 26 juli 2026
Je website staat online, en ergens deze week komt er een bot langs die je pagina's leest om er een AI-model mee te trainen of om er direct antwoorden uit te halen. Dat gebeurt zonder dat je het merkt, en tot voor kort zonder dat je er iets over te zeggen had. Inmiddels kun je wel degelijk kiezen. Maar de vraag is niet alleen hoe je AI-bots buiten de deur houdt, maar vooral: wil je dat eigenlijk wel?
Drie soorten bots, drie verschillende afwegingen
Het woord "AI-crawler" dekt drie heel verschillende dingen, en ze door elkaar halen leidt tot verkeerde keuzes.
Trainingscrawlers verzamelen tekst om toekomstige modellen mee te trainen. GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended en CCBot (Common Crawl) vallen hieronder. Jouw content verdwijnt in een model en komt er nooit meer met bronvermelding uit. Hier krijg je niets voor terug.
Antwoordbots halen tijdens een gesprek live een pagina op om de gebruiker een actueel antwoord te geven, vaak mét bronlink. Dat lijkt meer op een zoekmachine: je levert content, je krijgt zichtbaarheid en soms bezoekers.
Zoekmachine-crawlers zijn de klassieke Googlebot en Bingbot. Die wil je vrijwel zeker binnenlaten, want dat is je organische verkeer. Let op: Google splitst dit bewust. Googlebot doet de zoekindex, Google-Extended gaat over AI-training. Je kunt de tweede weigeren zonder je positie in Google te schaden.
Hoe je het regelt
De eenvoudigste route is robots.txt, het tekstbestand in de hoofdmap van je site. Wil je alleen trainingscrawlers weren, dan zet je daar bijvoorbeeld regels in voor GPTBot, ClaudeBot, CCBot en Google-Extended, met Disallow: / eronder. Googlebot laat je gewoon ongemoeid.
Belangrijk om te weten: robots.txt is een verzoek, geen slot op de deur. Het werkt op vrijwilligheid. De grote, gevestigde partijen houden zich eraan, want hun reputatie hangt ervan af. Onbekende scrapers negeren het straal. Wil je echt blokkeren, dan heb je iets nodig op serverniveau of bij je hostingprovider of CDN. Cloudflare biedt bijvoorbeeld een instelling om AI-bots te weren, en die werkt afdwingend in plaats van vragend.
Daarnaast wint een nieuw idee terrein: llms.txt, een bestand waarin je juist netjes aangeeft wat een AI-systeem wél mag gebruiken en hoe je site in elkaar zit. Het is een voorstel, geen standaard, en lang niet iedereen ondersteunt het. Maar het laat de richting zien waarin dit gesprek beweegt: van alles-of-niets naar afspraken.
De afweging die er echt toe doet
Blokkeren voelt intuïtief als het beschermen van je werk. Maar bedenk wat je opgeeft. Steeds meer mensen stellen hun vraag rechtstreeks aan een AI-assistent in plaats van aan een zoekmachine. Als jouw kennis in die antwoorden ontbreekt, besta je in dat kanaal simpelweg niet. Voor wie het van gevonden worden moet hebben, is volledige afsluiting een reëel risico.
Een bruikbare middenweg voor de meeste organisaties: weiger trainingscrawlers, laat antwoordbots binnen. Je content voedt dan geen model dat jou later beconcurreert, maar je blijft wel vindbaar op het moment dat iemand een vraag stelt. Voor uitgevers en makers die van hun content leven kan volledig blokkeren wél logisch zijn, zeker als er onderhandeling of licentie in het spel is.
En juridisch?
De EU AI Act verplicht aanbieders van algemene AI-modellen om het auteursrecht te respecteren en openheid te geven over de data waarop is getraind. Onder de Europese auteursrechtregels mogen rechthebbenden zich bovendien verzetten tegen tekst- en datamining voor commerciële doeleinden, mits dat voorbehoud machineleesbaar is vastgelegd. Precies daarom is dat regeltje in je robots.txt meer dan een technisch verzoek: het is de plek waar je dat voorbehoud kenbaar maakt. Hoe dit in de praktijk wordt gehandhaafd, is nog volop in ontwikkeling. Bij commerciële belangen loont het om juridisch advies in te winnen in plaats van te vertrouwen op een tekstbestandje.
Kort samengevat
- Onderscheid trainingscrawlers van antwoordbots, en houd zoekmachines apart.
- robots.txt is de standaardroute, maar werkt op vrijwilligheid. Voor harde blokkering heb je je server of CDN nodig.
- Google-Extended weigeren raakt je Google-posities niet.
- Volledig blokkeren beschermt je content, maar maakt je onzichtbaar in een groeiend kanaal.
Wie wil begrijpen waaróm die trainingsdata er voor modellen zo toe doet, en waarom een AI-antwoord met bronlink fundamenteel iets anders is dan een antwoord uit het geheugen van het model, leest verder in hoe een AI-model wordt gemaakt en wat een LLM is.