Le droit des systèmes d'IA de lire votre site se règle dans un seul fichier texte à la racine : uwdomein.be/robots.txt. Vous y indiquez par robot s'il a le droit d'entrer et ce n'est pas du tout ou rien, car les robots font un travail différent : GPTBot rassemble des données d'entraînement, OAI-SearchBot assure l'affichage dans les résultats de recherche de ChatGPT et ChatGPT-User va chercher une page après que l'utilisateur a cliqué sur un lien. Si vous voulez être cité sans finir dans les données d'entraînement, vous refusez le premier et vous autorisez les deux autres. Plus important que ce choix est le contrôle ensuite, car l'invisibilité dans les réponses IA vient rarement du robots.txt en pratique et le plus souvent d'un plugin de sécurité, d'un CDN ou d'un pare-feu qui bloque ces robots sans que personne l'ait demandé.
Le robots.txt en une minute
C'est un fichier texte sur uwdomein.be/robots.txt. Lisible publiquement, vous pouvez donc ouvrir celui de votre concurrent aussi bien que le vôtre.
C'est une demande et non une serrure. Les crawlers corrects s'y tiennent. Un scraper qui l'ignore, vous ne l'arrêtez pas avec cela. Si vous voulez vraiment protéger quelque chose, il vous faut un mot de passe ou une règle de pare-feu. Par ailleurs, le robots.txt règle si un robot a le droit de lire et non si votre page entre dans l'index. Cette distinction figure au chapitre 1.
Un point technique casse la plupart des fichiers. Les règles valent par bloc User-agent et un robot ne lit que le bloc qui correspond le mieux à son nom. Il ne lit donc pas à la fois son propre bloc et celui de User-agent: *. Si vous mettez proprement un Disallow: /admin/ sous l'astérisque et que vous ajoutez ensuite un bloc pour GPTBot avec seulement Allow: /, alors GPTBot a bien le droit d'entrer dans votre écran d'administration. Répétez vos règles Disallow dans chaque bloc où elles doivent valoir. Dans l'exemple plus bas, cela se fait en plaçant plusieurs lignes User-agent au-dessus d'un seul jeu de règles.
Trois sortes d'accès que presque tout le monde confond
L'entraînement. Le matériau avec lequel un modèle est entraîné. Si vous bloquez cela, votre texte n'entre pas dans une version suivante du modèle. Cela ne veut pas dire que vous disparaissez des réponses, car les réponses sur des sujets d'actualité viennent aujourd'hui en grande partie d'une recherche faite sur le moment.
L'affichage dans les résultats de recherche de l'assistant. C'est le robot qui va chercher votre page pendant que l'assistant cherche. Si vous bloquez celui-là, l'assistant ne peut pas vous citer. C'est l'accès qui compte si vous voulez être nommé.
La récupération après un clic. L'utilisateur colle votre lien ou demande à l'assistant de résumer votre page. Si vous bloquez celui-là, votre propre visiteur reçoit le message que la page ne peut pas être lue.
Bloquez seulement le premier groupe et vous restez citable. Bloquez tout et vous disparaissez des réponses.
Les crawlers par leur nom
| Nom | De qui | Ce qu'il fait |
|---|---|---|
GPTBot
|
OpenAI | Rassemble des données d'entraînement |
OAI-SearchBot
|
OpenAI | Assure l'affichage dans les résultats de recherche de ChatGPT |
ChatGPT-User
|
OpenAI | Va chercher une page après que l'utilisateur a cliqué |
Google-Extended
|
Détermine l'usage dans Gemini et les produits apparentés | |
ClaudeBot
|
Anthropic | Rassemble des données d'entraînement |
Claude-User
|
Anthropic | Va chercher une page après qu'un utilisateur la demande à Claude |
Claude-SearchBot
|
Anthropic | Construit l'index de recherche derrière les réponses |
PerplexityBot, Perplexity-User
|
Perplexity |
Deux noms. Le suffixe -User renvoie à une récupération après une action de l'utilisateur
|
Applebot, Applebot-Extended
|
Apple |
La même construction que chez Google : la variante avec Extended règle l'usage IA séparément
|
CCBot
|
Common Crawl | Une archive publique qui alimente indirectement beaucoup d'autres systèmes |
cohere-ai, Meta-ExternalAgent
|
Cohere et Meta | Des crawlers de fournisseurs d'IA |
Bingbot, DuckDuckBot, YandexBot
|
Microsoft, DuckDuckGo, Yandex | Moteurs de recherche classiques. Ceux-là n'ont pas leur place dans la rangée IA et vous les autorisez presque toujours |
Les noms Claude-Web et anthropic-ai étaient les anciens noms d'Anthropic. Depuis février 2026, ils sont supprimés et remplacés par les trois ci-dessus. Ils peuvent quitter votre fichier et si vous les y laissez, ils ne font aucun mal parce que plus rien ne passe sous ce nom.
Deux remarques sur cette liste. Elle change : les fournisseurs ajoutent des noms, renomment des robots et ne décrivent pas toujours le rôle avec la même netteté. Notez deux fois par an dans votre agenda de relire ce fichier. Et ne fondez aucun choix strict sur un rôle que vous lisez ici sans le vérifier dans la documentation du fournisseur lui-même.
Googlebot n'y figure délibérément pas. Il relève de User-agent: * et n'a besoin d'aucun bloc propre. Google-Extended est un nom distinct qui règle uniquement l'usage IA et ne change rien à votre position ordinaire dans Google.
Un robots.txt à reprendre
Remplacez les chemins d'exemple et l'URL du sitemap. Le reste peut rester tel quel.
# robots.txt pour uwdomein.be
# Les moteurs de recherche et les assistants IA peuvent lire et citer ce site.
# Dernière vérification : 3 août 2026
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
# Moteurs de recherche classiques
User-agent: Bingbot
User-agent: DuckDuckBot
User-agent: YandexBot
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
# Assistants IA : affichage dans les résultats et récupération après un clic
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Applebot
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
# Données d'entraînement
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: cohere-ai
User-agent: Meta-ExternalAgent
Allow: /
Disallow: /admin/
Disallow: /klantenzone/
Sitemap: https://uwdomein.be/sitemap.xml
Si vous voulez bien être cité sans servir à l'entraînement, remplacez dans le dernier bloc Allow: / par Disallow: /. Le reste reste en place. C'est toute l'intervention.
Notre propre choix est de tout autoriser. Nous publions ce guide pour être lus et un modèle qui n'a pas le droit de lire notre texte ne nous cite jamais. Pour un éditeur qui vit de licences, l'arbitrage est différent. Il n'y a pas de réponse universellement juste ici.
Les aperçus IA de Google et pourquoi le robots.txt ne traite pas de cela
Si vous bloquez Google-Extended, vous restez simplement dans les résultats de recherche de Google. Googlebot est un autre robot et vous ne le perdez pas avec cela.
Ce que Google-Extended touche exactement ou non à l'intérieur des composants IA de la recherche Google n'est pas entièrement transparent. Si vous voulez avec certitude rester en dehors d'un aperçu IA, le seul bouton dur est la commande d'extrait : nosnippet dans votre balise robots ou data-nosnippet autour d'un morceau de texte. Cela désactive aussi votre extrait ordinaire dans les résultats de recherche. C'est un prix élevé.
Et c'est un prix pour un problème que vous n'avez peut-être pas. Lors de notre propre mesure de référence du 2 août 2026, aucune des quinze recherches en néerlandais effectuées en Belgique n'a produit d'aperçu IA de Google. Zéro sur quinze. Dans cette langue et dans cette région, cette couche n'existe donc quasiment pas aujourd'hui. Pour une PME flamande ou néerlandaise, le débat sur les aperçus IA reste ainsi théorique pour l'instant. En anglais, la situation est différente.
Notre balise robots reste donc index, follow, max-snippet:-1, max-image-preview:large. C'est l'inverse de nosnippet : vous donnez à Google et aux assistants toute la place pour vous montrer. Celui qui veut être cité ne rogne pas là-dessus.
Le blocage silencieux : plugin de sécurité, CDN et pare-feu
C'est selon notre expérience la cause la plus fréquente d'invisibilité dans les réponses IA. Ce n'est presque jamais un choix conscient. C'est un réglage que quelqu'un a activé un jour ou qui était actif par défaut.
D'où cela vient :
- Un plugin de sécurité avec une liste de robots écartés. Cette liste est tenue à jour par son auteur et non par vous.
- Un CDN ou un pare-feu avec gestion des robots. Certains fournisseurs ont un interrupteur portant un nom du genre bloquer les scrapers IA et il est parfois actif par défaut.
- Une page de contrôle qui veut d'abord exécuter du JavaScript avant que le vrai contenu arrive. Un crawler qui n'exécute pas de JavaScript reçoit cette page et rien d'autre.
- Une limitation de débit qui étrangle un crawler après quelques requêtes.
- Un blocage par pays. Les crawlers ne viennent pas nécessairement de votre pays.
- Un mur de cookies qui renvoie une page de consentement à la place de votre texte.
Ce qui est traître : votre robots.txt dit Allow: / et il est parfaitement correct. Le blocage se situe une couche plus haut, avant même que votre site ne commence. Un vérificateur de robots.txt ne signale rien, car il ne lit que le fichier.
Ce que nous avons trouvé sur notre propre site
Ce chapitre n'est pas théorique. Le 4 août 2026 nous avons consulté le journal des crawlers de semanu.be. En vingt-quatre heures : 229 requêtes de crawlers IA, 107 laissées passer et 122 en échec. Sur ces 122, un seul bot en représentait 120.
| Crawler | Autorisé | En échec |
|---|---|---|
| PerplexityBot | 1 | 120 |
| Googlebot | 64 | 1 |
| BingBot | 18 | 0 |
| ChatGPT-User, GPTBot, OAI-SearchBot | 13 | 0 |
| ClaudeBot | 11 | 0 |
Notre robots.txt autorisait alors dix-huit crawlers de façon explicite, PerplexityBot compris. Le fichier était juste. Le blocage se trouvait chez notre CDN : un interrupteur appelé Bot fight mode était activé. Il met au défi tout ce qui n'est pas reconnu comme bot vérifié, et Cloudflare avait retiré Perplexity de cette liste en août 2025, après un différend sur le comportement de leur crawler.
Le résultat : l'une des quatre grandes machines de réponse ne pouvait pas lire notre site alors que notre robots.txt l'accueillait. Cela expliquait aussitôt pourquoi cette machine ne nous citait nulle part dans notre propre mesure de visibilité. Pas un problème de contenu ni un problème d'écriture, mais une case à cocher.
La leçon à en retenir : le robots.txt est une déclaration d'intention et la couche qui le précède décide. Seul le journal des crawlers de votre CDN ou de votre serveur montre ce qui se passe vraiment.
Comment vérifier que cela fonctionne
| Contrôle | Ce que vous faites | Ce que vous voulez voir |
|---|---|---|
| Votre propre fichier |
Ouvrir uwdomein.be/robots.txt dans le navigateur
|
Aucun Disallow: / sur une ligne propre
|
| Le regard de Google | Le rapport robots.txt dans la Search Console | Récupéré sans erreur de lecture |
| L'accessibilité réelle |
curl avec un nom de robot comme user-agent
|
Code de statut 200 et votre propre texte |
| Qui passe | Fouiller votre journal d'accès à la recherche de noms de robots | Des lignes de plusieurs robots au cours des derniers mois |
Le troisième contrôle est le seul qui attrape le blocage silencieux. Une ligne dans un terminal :
curl -s -o /dev/null -w "%{http_code}\n" \
-A "OAI-SearchBot" https://uwdomein.be/
Vous voulez voir 200. Si vous obtenez 403, 429 ou 503, quelque chose retient. Répétez pour GPTBot, ClaudeBot et PerplexityBot.
Un 200 n'est pas d'office une bonne nouvelle, car une page de contrôle en donne un aussi. Regardez donc également ce qui revient :
curl -s -A "ClaudeBot" https://uwdomein.be/ | head -c 400
Si vous voyez vos propres titres et votre texte, tout est en ordre. Si vous voyez un message de sécurité ou une page vide avec seulement un script, quelque chose se trouve entre vous et le robot.
Ce que le robots.txt ne règle pas
Il ne vous retire pas des réponses qui existent déjà. Ce qu'un modèle a appris, il ne l'oublie pas parce que vous ajoutez une ligne aujourd'hui.
Il n'arrête aucun scraper qui n'en tient pas compte.
Il ne détermine pas si vous êtes indexé. C'est le chapitre 1.
Et il ne produit aucune citation. L'accès est la condition et non le résultat. Le chapitre 6 aligne les quatre facteurs et l'accès en est un. Pour savoir si cela fonctionne, vous mesurez comme décrit au chapitre 9.
Ce que vous pouvez faire vous-même et ce que vous ne pouvez pas
À faire vous-même, sans développeur :
-
Ouvrir et lire
uwdomein.be/robots.txt. Cinq minutes et c'est le contrôle le moins cher de tout ce guide. - Reprendre le fichier ci-dessus et adapter les chemins Disallow et l'URL du sitemap.
-
Effectuer le test curl pour quatre noms de robots. Sur Mac et Linux,
curlest déjà présent et sous Windows il se trouve dans PowerShell. - Consulter le rapport robots.txt de la Search Console.
- Chercher dans le panneau de configuration de votre CDN ou de votre plugin de sécurité un interrupteur autour des robots.
Ce pour quoi vous avez besoin d'aide :
- Une règle de gestion des robots chez votre CDN que seul votre hébergeur peut désactiver.
- Un pare-feu qui bloque sur la base du comportement plutôt que sur le nom. Aucune règle du robots.txt n'y peut quoi que ce soit.
- Un site qui ne construit le contenu qu'en JavaScript. Ce n'est alors pas l'accès qui pose problème mais la lisibilité.
- L'accès au journal du serveur si vous ne l'avez pas. Demandez à votre hébergeur un extrait avec les noms de robots dedans.
L'exercice complet représente une demi-heure. C'est avec le chapitre 1 la seule partie de ce guide où un seul réglage peut faire la différence entre exister et ne pas exister pour un moteur de réponse IA.
Questions fréquentes
Qu'est-ce que le robots.txt et où le trouver ?
Un fichier texte à la racine de votre site, à ouvrir sur uwdomein.be/robots.txt. Il indique par crawler quelles parties de votre site il a le droit de récupérer. C'est une demande et non une serrure : les robots corrects s'y tiennent et un scraper qui l'ignore, vous ne l'arrêtez pas avec cela.
Dois-je bloquer GPTBot ?
Uniquement si vous ne voulez pas que vos textes finissent dans les données d'entraînement d'OpenAI. Bloquer GPTBot ne vous retire pas des réponses de ChatGPT, car ce sont OAI-SearchBot et ChatGPT-User qui s'en chargent. Celui qui veut être nommé dans les réponses IA laisse donc entrer ces deux-là, même s'il refuse GPTBot.
Comment vérifier que mon robots.txt fonctionne ?
Ouvrez d'abord le fichier vous-même dans votre navigateur et cherchez une ligne Disallow: /. Consultez ensuite le rapport robots.txt dans Google Search Console. Le vrai test est une requête avec le nom du robot comme user-agent, par exemple avec curl : vous voulez voir le code de statut 200 et récupérer votre propre texte.
Mon hébergement ou mon CDN peut-il bloquer des robots d'IA à mon insu ?
Oui. C'est même selon notre expérience la cause la plus fréquente d'invisibilité dans les réponses IA. Les plugins de sécurité, la gestion des robots chez un CDN, les pages de contrôle qui exigent du JavaScript et les limitations de débit écartent des robots alors que votre robots.txt les autorise proprement. Vous ne le remarquez qu'en faisant une requête avec le nom du robot comme user-agent.
Comment entrer dans les aperçus IA de Google ?
Il n'existe aucun réglage qui active cela. Google puise pour ces aperçus dans son index ordinaire, une bonne visibilité reste donc la condition. Lors de notre propre mesure du 2 août 2026, aucune des quinze recherches en néerlandais effectuées en Belgique n'a produit d'aperçu IA, donc pour ce marché la question reste théorique aujourd'hui.
Vous préférez ne pas le faire vous-même : SEMANU réalise l'audit SEO et GEO complet pour 1 450 euros, rapport et séance de travail compris. Le détail figure sur la page du guide.
La mesurabilité et la visibilité font partie de votre stratégie logicielle
La mesurabilité et la visibilité relèvent du conseil stratégique et ne sont pas une discipline à part. Si vous préférez ne pas le faire vous-même, nous l'intégrons à la stratégie logicielle : ce que vous mesurez, le seuil qui justifie une action et qui en assure le suivi.