Of AI-systemen uw site mogen lezen staat in één tekstbestand op uw hoofdmap: uwdomein.be/robots.txt. Daarin geeft u per bot aan of hij binnen mag en dat is geen alles-of-niets, want de bots doen verschillend werk: GPTBot verzamelt trainingsdata, OAI-SearchBot zorgt voor de weergave in de zoekresultaten van ChatGPT en ChatGPT-User haalt een pagina op nadat de gebruiker op een link klikt. Wilt u geciteerd worden zonder in de trainingsdata te belanden, dan weigert u de eerste en laat u de andere twee toe. Belangrijker dan die keuze is de controle achteraf, want onzichtbaarheid in AI-antwoorden komt in de praktijk zelden uit robots.txt en meestal uit een securityplugin, een CDN of een firewall die deze bots blokkeert zonder dat iemand het gevraagd heeft.
robots.txt in één minuut
Het is een tekstbestand op uwdomein.be/robots.txt. Publiek leesbaar, dus u kan dat van uw concurrent net zo goed openen als het uwe.
Het is een verzoek en geen slot. Nette crawlers houden zich eraan. Een scraper die het negeert houdt u er niet mee tegen. Wilt u iets echt afschermen, dan heeft u een wachtwoord of een firewallregel nodig. Verder regelt robots.txt of een bot mag lezen en niet of uw pagina in de index komt. Dat onderscheid staat in hoofdstuk 1.
Eén technisch punt dat de meeste bestanden stukmaakt. Regels gelden per User-agent-blok en een bot leest alleen het blok dat het best bij zijn naam past. Hij leest dus niet én zijn eigen blok én dat van User-agent: *. Zet u netjes een Disallow: /admin/ onder de ster en voegt u daarna een blok toe voor GPTBot met alleen Allow: /, dan mag GPTBot wel in uw beheerscherm. Herhaal uw Disallow-regels in elk blok waar ze moeten gelden. In het voorbeeld verderop gebeurt dat door meerdere User-agent-regels boven één set regels te zetten.
Drie soorten toegang die bijna iedereen door elkaar haalt
Training. Het materiaal waarmee een model geleerd wordt. Blokkeert u dit, dan komt uw tekst niet in een volgende versie van het model. Het betekent niet dat u uit de antwoorden verdwijnt, want antwoorden over actuele onderwerpen komen tegenwoordig grotendeels uit een zoekopdracht op het moment zelf.
Weergave in de zoekresultaten van de assistent. Dit is de bot die uw pagina ophaalt terwijl de assistent aan het zoeken is. Blokkeert u deze, dan kan de assistent u niet citeren. Dit is de toegang die telt als u genoemd wil worden.
Ophalen na een klik. De gebruiker plakt uw link of vraagt de assistent om uw pagina samen te vatten. Blokkeert u deze, dan krijgt uw eigen bezoeker de melding dat de pagina niet gelezen kan worden.
Blokkeer alleen de eerste groep en u blijft citeerbaar. Blokkeer alles en u bent weg uit de antwoorden.
De crawlers bij naam
| Naam | Van wie | Wat hij doet |
|---|---|---|
GPTBot
|
OpenAI | Verzamelt trainingsdata |
OAI-SearchBot
|
OpenAI | Zorgt voor de weergave in de zoekresultaten van ChatGPT |
ChatGPT-User
|
OpenAI | Haalt een pagina op nadat de gebruiker klikt |
Google-Extended
|
Bepaalt het gebruik in Gemini en aanverwante producten | |
ClaudeBot
|
Anthropic | Verzamelt trainingsdata |
Claude-User
|
Anthropic | Haalt een pagina op nadat een gebruiker het aan Claude vraagt |
Claude-SearchBot
|
Anthropic | Bouwt de zoekindex achter de antwoorden |
PerplexityBot, Perplexity-User
|
Perplexity |
Twee namen. Het achtervoegsel -User wijst op ophalen na een handeling van de gebruiker
|
Applebot, Applebot-Extended
|
Apple |
Dezelfde opbouw als bij Google: de variant met Extended regelt het AI-gebruik apart
|
CCBot
|
Common Crawl | Een openbaar archief dat indirect veel andere systemen voedt |
cohere-ai, Meta-ExternalAgent
|
Cohere en Meta | Crawlers van AI-leveranciers |
Bingbot, DuckDuckBot, YandexBot
|
Microsoft, DuckDuckGo, Yandex | Klassieke zoekmachines. Deze horen niet in het AI-rijtje en u laat ze vrijwel altijd toe |
De namen Claude-Web en anthropic-ai waren de oude namen van Anthropic. Sinds februari 2026 zijn ze afgeschaft en vervangen door de drie hierboven. Ze mogen uit uw bestand, en als u ze laat staan doen ze geen kwaad omdat er niets meer onder die naam langskomt.
Twee kanttekeningen bij deze lijst. Ze verandert: leveranciers voegen namen toe, hernoemen bots en beschrijven de rol niet altijd even scherp. Zet twee keer per jaar in uw agenda dat u dit bestand naleest. En baseer geen strikte keuze op een rol die u hier leest zonder ze te toetsen aan de documentatie van de leverancier zelf.
Googlebot staat er bewust niet bij. Die valt onder User-agent: * en heeft geen eigen blok nodig. Google-Extended is een aparte naam die alleen het AI-gebruik regelt en niets verandert aan uw gewone positie in Google.
Een robots.txt om over te nemen
Vervang de voorbeeldpaden en de sitemap-URL. De rest kan blijven staan.
# robots.txt voor uwdomein.be
# Zoekmachines en AI-assistenten mogen deze site lezen en citeren.
# Laatst nagekeken: 3 augustus 2026
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
# Klassieke zoekmachines
User-agent: Bingbot
User-agent: DuckDuckBot
User-agent: YandexBot
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
# AI-assistenten: weergave in de resultaten en ophalen na een klik
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Applebot
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
# Trainingsdata
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: cohere-ai
User-agent: Meta-ExternalAgent
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
Sitemap: https://uwdomein.be/sitemap.xml
Wilt u wel geciteerd worden en niet meegetraind, vervang dan in het laatste blok Allow: / door Disallow: /. De rest blijft staan. Dat is de hele ingreep.
Onze eigen keuze is alles toelaten. Wij publiceren de gids om gelezen te worden en een model dat onze tekst niet mag lezen citeert ons nooit. Voor een uitgever die van licenties leeft ligt die afweging anders. Er is hier geen algemeen juist antwoord.
AI-overzichten van Google en waarom robots.txt daar niet over gaat
Blokkeert u Google-Extended, dan blijft u gewoon in de zoekresultaten van Google staan. Googlebot is een andere bot en die raakt u er niet mee kwijt.
Wat Google-Extended precies wel en niet raakt binnen de AI-onderdelen van Google Zoeken is niet volledig doorzichtig. Wilt u met zekerheid buiten een AI-overzicht blijven, dan is de enige harde knop de fragmentbesturing: nosnippet in uw robots-meta of data-nosnippet rond een stuk tekst. Die zet ook uw gewone fragment in de zoekresultaten uit. Dat is een dure prijs.
En het is een prijs voor een probleem dat u misschien niet heeft. Bij onze eigen nulmeting van 2 augustus 2026 verscheen voor geen enkele van vijftien Nederlandstalige zoekopdrachten in België een AI-overzicht van Google. Nul op vijftien. In die taal en die regio bestaat die laag vandaag dus nauwelijks. Voor een Vlaamse of Nederlandse kmo is de discussie over AI-overzichten daarmee voorlopig theoretisch. In het Engels ligt dat anders.
Onze robots-meta blijft daarom index, follow, max-snippet:-1, max-image-preview:large. Dat is het omgekeerde van nosnippet: u geeft Google en de assistenten alle ruimte om u te tonen. Wie geciteerd wil worden knijpt daar niet in.
De stille blokkade: securityplugin, CDN en firewall
Dit is in onze ervaring de meest voorkomende oorzaak van onzichtbaarheid in AI-antwoorden. Het is bijna nooit een bewuste keuze. Het is een instelling die iemand ooit aanzette of die standaard aanstond.
Waar het vandaan komt:
- Een securityplugin met een lijst van geweerde bots. Die lijst wordt bijgewerkt door de maker en niet door u.
- Een CDN of firewall met botbeheer. Sommige aanbieders hebben een schakelaar met een naam als AI-scrapers blokkeren en die staat soms standaard aan.
- Een controlepagina die eerst JavaScript wil draaien voordat de echte inhoud komt. Een crawler die geen JavaScript uitvoert krijgt die pagina en niets anders.
- Snelheidsbeperking die een crawler na enkele aanvragen afknijpt.
- Een landenblokkade. Crawlers komen niet noodzakelijk uit uw land.
- Een cookiemuur die een toestemmingspagina teruggeeft in plaats van uw tekst.
Het verraderlijke eraan: uw robots.txt zegt Allow: / en klopt volledig. De blokkade zit een laag hoger, nog voor uw site begint. Een robots.txt-controleur meldt niets, want die leest alleen het bestand.
Wat we op onze eigen site vonden
Dit hoofdstuk is niet theoretisch. Op 4 augustus 2026 keken we in het crawlerlogboek van semanu.be. In vierentwintig uur: 229 aanvragen van AI-crawlers, 107 doorgelaten en 122 mislukt. Van die 122 kwamen er 120 van één bot.
| Crawler | Doorgelaten | Mislukt |
|---|---|---|
| PerplexityBot | 1 | 120 |
| Googlebot | 64 | 1 |
| BingBot | 18 | 0 |
| ChatGPT-User, GPTBot, OAI-SearchBot | 13 | 0 |
| ClaudeBot | 11 | 0 |
Onze robots.txt liet op dat moment achttien crawlers expliciet toe, PerplexityBot inbegrepen. Het bestand klopte. De blokkade zat bij onze CDN: een schakelaar met de naam Bot fight mode stond aan. Die daagt alles uit wat niet als geverifieerde bot herkend wordt. Cloudflare had Perplexity in augustus 2025 van die lijst gehaald na een geschil over de manier waarop hun crawler zich gedroeg.
Het gevolg: één van de vier grote antwoordmachines kon onze site niet lezen, terwijl ons robots.txt hem welkom heette. Dat verklaarde meteen waarom die machine ons in onze eigen zichtbaarheidsmeting nergens noemde. Geen inhoudsprobleem en geen schrijfprobleem. Een vinkje.
De les die u hieruit kan meenemen: robots.txt is een intentieverklaring en de laag ervoor beslist. Alleen het crawlerlogboek van uw CDN of van uw server toont wat er echt gebeurt.
Hoe u controleert of het werkt
| Controle | Wat u doet | Wat u wil zien |
|---|---|---|
| Uw eigen bestand |
uwdomein.be/robots.txt in de browser openen
|
Geen Disallow: / op een eigen regel
|
| De kijk van Google | Het robots.txt-rapport in Search Console | Opgehaald zonder leesfouten |
| Echte bereikbaarheid |
curl met een botnaam als user-agent
|
Statuscode 200 en uw eigen tekst |
| Wie er langskomt | Uw toegangslogboek doorzoeken op botnamen | Regels van meerdere bots in de voorbije maanden |
De derde controle is de enige die de stille blokkade vangt. Eén regel in een terminal:
curl -s -o /dev/null -w "%{http_code}\n" \
-A "OAI-SearchBot" https://uwdomein.be/
U wil 200 zien. Krijgt u 403, 429 of 503, dan houdt er iets tegen. Herhaal voor GPTBot, ClaudeBot en PerplexityBot.
Een 200 is niet vanzelf goed nieuws, want een controlepagina geeft die ook. Kijk daarom ook naar wat er terugkomt:
curl -s -A "ClaudeBot" https://uwdomein.be/ | head -c 400
Ziet u uw eigen kopregels en tekst, dan is het in orde. Ziet u een beveiligingsmelding of een lege pagina met alleen een script, dan zit er iets tussen u en de bot.
Wat robots.txt niet regelt
Het haalt u niet uit antwoorden die al bestaan. Wat een model geleerd heeft vergeet het niet omdat u vandaag een regel toevoegt.
Het houdt geen scraper tegen die zich er niets van aantrekt.
Het bepaalt niet of u geïndexeerd wordt. Dat is hoofdstuk 1.
En het levert geen citaties op. Toegang is de voorwaarde en niet de uitkomst. Hoofdstuk 6 zet de vier factoren op een rij en toegang is er daar één van. Of het werkt meet u zoals beschreven in hoofdstuk 9.
Wat u zelf kan en wat niet
Zelf te doen, zonder ontwikkelaar:
-
uwdomein.be/robots.txtopenen en lezen. Vijf minuten en het is de goedkoopste controle in deze hele gids. - Het bestand hierboven overnemen en de Disallow-paden en de sitemap-URL aanpassen.
-
De curl-test draaien voor vier botnamen. Op Mac en Linux staat
curler al op en op Windows zit het in PowerShell. - Het robots.txt-rapport van Search Console bekijken.
- In het configuratiescherm van uw CDN of securityplugin zoeken naar een schakelaar rond bots.
Waarvoor u hulp nodig heeft:
- Een botbeheerregel bij uw CDN die alleen uw hoster kan uitzetten.
- Een firewall die op basis van gedrag blokkeert in plaats van op naam. Daar helpt geen enkele regel in robots.txt tegen.
- Een site die de inhoud pas via JavaScript opbouwt. Dan is toegang niet het probleem en de leesbaarheid wel.
- Toegang tot het serverlogboek als u die niet heeft. Vraag uw hoster om een uittreksel met de botnamen erin.
De hele oefening is een halfuur. Het is samen met hoofdstuk 1 het enige onderdeel van deze gids waar één instelling het verschil kan maken tussen wel en niet bestaan voor een AI-antwoordmachine.
Veelgestelde vragen
Wat is robots.txt en waar vind ik het?
Een tekstbestand in de hoofdmap van uw website, te openen op uwdomein.be/robots.txt. Daarin staat per crawler welke delen van uw site hij mag ophalen. Het is een verzoek en geen slot: nette bots houden zich eraan en een scraper die het negeert houdt u er niet mee tegen.
Moet ik GPTBot blokkeren?
Alleen als u niet wil dat uw teksten in de trainingsdata van OpenAI belanden. Het blokkeren van GPTBot haalt u niet uit de antwoorden van ChatGPT, want daarvoor zorgen OAI-SearchBot en ChatGPT-User. Wie in AI-antwoorden genoemd wil worden laat die twee dus binnen, ook wanneer hij GPTBot weigert.
Hoe controleer ik of mijn robots.txt werkt?
Open het bestand eerst zelf in uw browser en zoek naar een regel Disallow: /. Bekijk daarna het robots.txt-rapport in Google Search Console. De echte test is een aanvraag met de naam van de bot als user-agent, bijvoorbeeld met curl: u wil statuscode 200 zien en uw eigen tekst terugkrijgen.
Kan mijn hosting of CDN AI-bots blokkeren zonder dat ik het weet?
Ja. Dat is in onze ervaring zelfs de meest voorkomende oorzaak van onzichtbaarheid in AI-antwoorden. Securityplugins, botbeheer bij een CDN, controlepagina's die JavaScript vereisen en snelheidsbeperkingen weren bots terwijl uw robots.txt hen netjes toelaat. U merkt het alleen door een aanvraag te doen met de botnaam als user-agent.
Hoe kom ik in de AI-overzichten van Google?
Er bestaat geen instelling die dat aanzet. Google put voor die overzichten uit zijn gewone index, dus goede vindbaarheid blijft de voorwaarde. Bij onze eigen meting van 2 augustus 2026 verscheen er voor geen enkele van vijftien Nederlandstalige zoekopdrachten in België een AI-overzicht, dus voor die markt is het vandaag nog een theoretische vraag.
Wenst u dit niet zelf te doen: SEMANU voert de volledige SEO- en GEO-audit uit voor 1.450 euro, inclusief rapport en werksessie. Wat erin zit staat op de gidspagina.
Meetbaarheid en vindbaarheid horen in uw softwarestrategie
Meetbaarheid en vindbaarheid zijn onderdeel van strategisch advies en geen aparte discipline. Wilt u dit niet zelf doen, dan nemen we het op in de softwarestrategie: wat u meet, welke drempel een handeling rechtvaardigt en wie het opvolgt.