Direct antwoord: toestaan of blokkeren?
Voor de meeste MKB-bedrijven die zichtbaar willen zijn in AI-antwoorden (ChatGPT, Perplexity, Google AI Overviews): toestaan. Blokkeren is vooral zinvol als je primair leeft van directe bezoekers of advertentie-inkomsten op je eigen content en een vergoeding wilt voor hergebruik door AI-bedrijven — denk aan nieuwsmedia en uitgevers, niet aan een lokaal dienstverlenend MKB-bedrijf.
De keuze is niet alles-of-niets. Je kunt per bot een bewuste beslissing nemen: de ene crawler levert directe zichtbaarheidswaarde met bronvermelding, de andere traint alleen een model zonder duidelijke waarde terug.
De belangrijkste AI-crawlers op een rij
Zes crawlers zie je het vaakst in je serverlogs. Elk hoort bij een ander AI-platform, met een ander doel en een ander standaardgedrag.
| Crawler | Van | Doel | Standaardgedrag |
|---|---|---|---|
| GPTBot | OpenAI | Traint en verrijkt ChatGPT-antwoorden | Crawlt tenzij geblokkeerd via robots.txt |
| ClaudeBot | Anthropic | Training + realtime retrieval voor Claude | Crawlt tenzij geblokkeerd via robots.txt |
| PerplexityBot | Perplexity | Live-antwoorden met broncitaties | Crawlt tenzij geblokkeerd via robots.txt |
| GoogleOther / Google-Extended | Trainingsdata voor Gemini, los van Google Zoeken | Crawlt tenzij geblokkeerd via robots.txt | |
| Amazonbot | Amazon | Alexa en AI-diensten | Crawlt tenzij geblokkeerd via robots.txt |
| Bytespider | ByteDance (TikTok) | Trainingsdata voor TikTok- en Doubao-modellen | Crawlt vaak agressief; meldingen dat robots.txt niet altijd gerespecteerd wordt |
Hoe blokkeer je een AI-crawler via robots.txt
Blokkeren doe je per user-agent in je robots.txt. Onderstaand voorbeeld sluit alle grote AI-trainingscrawlers uit, terwijl Googlebot (de klassieke zoekindex-crawler) gewoon toegang houdt:
User-agent: GPTBot — Disallow: / · User-agent: ClaudeBot — Disallow: / · User-agent: PerplexityBot — Disallow: / · User-agent: Google-Extended — Disallow: / · User-agent: Amazonbot — Disallow: / · User-agent: Bytespider — Disallow: /
Let op: robots.txt is een verzoek, geen technische afsluiting. De meeste grote AI-bedrijven respecteren het netjes, maar er zijn herhaalde meldingen dat Bytespider zich er niet altijd aan houdt. Voor een harde blokkade heb je een extra laag nodig via je CDN of firewall (bijvoorbeeld de AI-bot-blocking-functie van Cloudflare).
De trade-offs: wat je wint en verliest
Blokkeren beschermt je content tegen training zonder vergoeding en bespaart bandbreedte bij agressieve crawlers. Maar het heeft een directe keerzijde: blokkeren betekent onzichtbaar zijn in AI-antwoorden. Geen citaties, geen brand-mentions in ChatGPT- of Perplexity-antwoorden, geen kans om als bron te worden aangehaald wanneer een potentiële klant een AI-tool om advies vraagt.
Voor een dienstverlenend MKB-bedrijf is dat een reële omzetafweging: elke AI-conversatie waarin je niet genoemd wordt, is een potentiële lead die naar een concurrent gaat die wél toegankelijk is voor deze crawlers.
Aanbeveling per bedrijfstype
MKB dat leads en zichtbaarheid wil (de meerderheid van onze klanten): sta alle grote AI-bots toe. De zichtbaarheidswinst weegt vrijwel altijd op tegen het risico van contenthergebruik.
Content-uitgevers en nieuwsmedia die primair leven van abonnementen of advertenties op hun eigen content: overweeg selectief blokkeren, of onderhandel over een licentie — vergelijkbaar met de deals die grote uitgevers en platforms als Reddit met AI-bedrijven hebben gesloten.
E-commerce met prijsgevoelige data: overweeg specifiek prijs-scraping-bots te blokkeren, maar houd de grote AI-crawlers open voor productvindbaarheid in AI-shopping-antwoorden.
Praktisch voorbeeld: bewust toestaan
Toestaan vraagt meestal geen actie: zonder Disallow-regel voor een user-agent crawlt de bot gewoon. Voor de duidelijkheid documenteren veel bedrijven dat toch expliciet in robots.txt, zodat toekomstige beheerders in één oogopslag zien dat de keuze bewust is gemaakt, niet per ongeluk vergeten.
User-agent: GPTBot — Allow: / · User-agent: ClaudeBot — Allow: / · User-agent: PerplexityBot — Allow: /
Let op: Google-Extended is niet Googlebot
Google-Extended is een apart token, specifiek voor het trainen van Gemini en andere AI-producten — losstaand van de klassieke Googlebot die je site indexeert voor Google Zoeken. Je kunt AI-training bij Google blokkeren zonder je organische ranking te raken, zolang je Googlebot zelf niet blokkeert. Controleer dit onderscheid altijd voordat je een blanket-regel toevoegt.
Twijfel je welke crawlers je moet toestaan?
Vraag een GEO-strategiegesprek aan →
