AI-crawlers blokkeren of binnenlaten? (2026)

Gepubliceerd op 20 september 2026


1) Wie komt er langs?2) Trainen of ophalen: het verschil dat telt3) Wat win en verlies je?4) Hoe stel je het in?5) Ons advies per type site6) Hoe zie je wie er langskwam?- Conclusie

In je serverlogs staan namen die er vijf jaar geleden nog niet waren: GPTBot, ClaudeBot, PerplexityBot, Google-Extended. Ze halen je pagina's op, en jij hebt daar nooit ja op gezegd.

De vraag die klanten ons stellen is telkens dezelfde: moet ik die buitenzetten? Het antwoord hangt af van wat jij verkoopt, en van welke bot het precies is.

TL;DR

Wat: AI-crawlers zijn bots die je site ophalen om modellen te trainen of om een vraag van een gebruiker te beantwoorden.
Hoe: Je regelt ze in je robots.txt, bij je hostingprovider of via een dienst als Cloudflare. Per bot, niet in bulk.
Conclusie: Voor de meeste kmo's is binnenlaten de betere keuze: je wil net vermeld worden. Wie van zijn teksten of beelden leeft, heeft goede redenen om ze te weren.

1) Wie komt er eigenlijk langs?


Er lopen vandaag tientallen AI-crawlers rond. Dit zijn de namen die je in je logs zal zien.

  • GPTBot van OpenAI, voor het trainen van modellen. Daarnaast is er OAI-SearchBot, die ophaalt wat ChatGPT nodig heeft om een actuele vraag te beantwoorden.
  • ClaudeBot van Anthropic.
  • Google-Extended. Geen echte bot, maar een schakelaar: je gewone Googlebot blijft komen, en dit bepaalt of je materiaal ook voor Gemini gebruikt mag worden.
  • PerplexityBot, die vooral live ophaalt bij een vraag.
  • Applebot-Extended, hetzelfde idee als bij Google.
  • CCBot van Common Crawl, een openbaar archief waar veel modellen uit putten.
  • Bytespider van ByteDance, berucht omdat hij hard crawlt.

Die lijst verandert om de paar maanden. Kijk dus naar je eigen logs in plaats van een lijstje van internet te kopiëren.

2) Trainen of ophalen: het verschil dat telt


Dit is het stuk dat bijna elk artikel over dit onderwerp overslaat, en het beslist alles.

Een trainingsbot haalt je teksten op om er ooit een model mee te trainen. Je krijgt daar op korte termijn niets voor terug. Geen link, geen bezoeker, geen vermelding.

Een ophaalbot komt langs op het moment dat iemand een vraag stelt. Die haalt jouw pagina op om er nu een antwoord mee te geven, meestal mét bronvermelding en een link naar jou.

Zet je alles in één keer buiten, dan gooi je die tweede groep mee weg. Je verdwijnt dan uit de antwoorden waar je net in wil staan. Dat is hetzelfde als Googlebot blokkeren omdat je Google niet vertrouwt.

De regel die wij hanteren: ophaalbots altijd binnenlaten, trainingsbots naar eigen inzicht.

3) Wat win je, wat verlies je?


Wat je wint door ze binnen te laten. Je bedrijf kan vermeld worden wanneer iemand aan ChatGPT of Perplexity vraagt wie er in zijn buurt iets doet. Dat verkeer is klein, maar het bestaat, en het groeit. Hoe je daarop inspeelt, staat in ons artikel over GEO en AI vindbaarheid.

Wat je verliest. Twee dingen. Je teksten worden overgenomen in een antwoord waar de lezer soms niet meer doorklikt, wat men zero click noemt. En sommige bots crawlen zo hard dat je server er traag van wordt. Dat laatste zien we vooral bij grote webshops en bij sites met veel filtercombinaties.

Wat je niet wint: bescherming van wat al gebeurd is. Een blokkering vandaag haalt je teksten niet uit modellen die vorig jaar getraind zijn.

4) Hoe stel je het in?


Er zijn drie plaatsen, van beleefd naar streng.

Je robots.txt

Een robots.txt is een vraag, geen slot. Nette bots houden zich eraan, de rest niet. Je zet er per bot een regel in met zijn naam en een Disallow. Belangrijk: doe dat per bot en niet met een sterretje, want dan sluit je Google mee buiten.

Je hosting of firewall

Daar kan je een bot echt tegenhouden in plaats van het te vragen. Bij Cloudflare zit er een schakelaar voor, die we bij klanten met serverlast gebruiken. Wat Cloudflare gratis voor je doet, schreven we eerder uit in ons artikel over Cloudflare.

Je WordPress-instellingen

Sommige SEO-plugins hebben er intussen een knop voor. Handig, maar kijk na wat ze precies schrijven in je robots.txt, want soms is dat meer dan je denkt.

En nee, een llms.txt is hier geen oplossing voor. Dat bestand nodigt uit, het houdt niemand tegen.

5) Ons advies per type site


  • Dienstenwebsite van een kmo: alles binnenlaten. Je wil gevonden en vermeld worden, en je teksten zijn geen product.
  • Webshop: binnenlaten, maar hou je serverlast in het oog en bescherm je feeds en je zoekpagina's tegen eindeloos crawlen.
  • Wie van content leeft, zoals een uitgever, fotograaf of opleidingsverstrekker: trainingsbots weren is verdedigbaar, ophaalbots binnenlaten meestal nog altijd verstandig.
  • Portfolio met eigen beeld: denk minstens na over Google-Extended en Applebot-Extended, en zet je licentie ergens duidelijk op je site.

Wat je in geen enkel geval doet: alles blokkeren en daarna klagen dat je nergens vermeld wordt.

6) Hoe zie je wie er langskwam?


Je hebt hier geen dure tool voor nodig.

Zit je op Plesk of cPanel, dan vind je onder je statistieken een overzicht van bezoekende bots. Zit je achter Cloudflare, dan staat het in je overzicht per bot. En wie toegang heeft tot de ruwe logbestanden, zoekt gewoon op de namen hierboven.

Kijk daarbij naar twee dingen: hoeveel pagina's ze ophalen en hoe vaak ze terugkomen. Een bot die je volledige webshop elke dag doorloopt, kost je rekenkracht. Een bot die twee keer per maand je nieuwe artikels leest, kost je niets.

Weet je niet waar je moet kijken, dan doen wij dat bij sites die we beheren standaard mee.

Conclusie


Samenvattend: er is geen algemeen goed antwoord, maar er is wel een verkeerd. Alles in één keer buitenzetten kost je vermeldingen zonder dat het je teksten beschermt.

Beslis per bot, maak het onderscheid tussen trainen en ophalen, en kijk naar je eigen logs in plaats van naar een lijstje op internet.

Wil je weten wie er bij jou langskomt en wat dat kost aan serverlast? Vraag een gratis audit aan.

Dit artikel werd geschreven door KNEET.

Wij zijn een Belgisch marketingbureau met een sterke focus op online marketing via kanalen zoals Facebook, Instagram, nieuwsbrieven en Google Ads. Daarnaast bouwen en optimaliseren we converterende websites en webshops.
Sinds 2016 kenden we al 100+ tevreden klanten in tal van sectoren.
Maken we binnenkort eens vrijblijvend kennis?

Genoeg gescrold!

Tijd voor actie. Het leven is aan de rappen. Uiteraard vrijblijvend!