En bref
- Les grands éditeurs séparent désormais leurs robots : un pour l’entraînement des modèles, un pour la recherche et la citation, parfois un troisième pour les visites déclenchées par un utilisateur.
- On peut donc refuser l’entraînement tout en restant citable dans ChatGPT, Claude ou Perplexity.
- Bloquer
Google-Extendedne retire pas un site des AI Overviews de Google : ceux-ci dépendent de Googlebot. - Derrière Cloudflare, vérifiez le robots.txt réellement servi et les réglages « AI Crawl Control » : ils peuvent bloquer ce que votre robots.txt autorise.
Pour un site B2B, être repris et cité par les assistants IA devient un canal d’acquisition à part entière : c’est l’objet du GEO (Generative Engine Optimization). Le premier réglage se fait dans un fichier vieux de trente ans : robots.txt. Encore faut-il savoir à qui l’on parle.
Le tableau des robots, d’après la documentation des éditeurs
| Éditeur | User-agent | Rôle | Respecte robots.txt |
|---|---|---|---|
| OpenAI | GPTBot | Entraînement des modèles | Oui |
| OpenAI | OAI-SearchBot | Recherche de ChatGPT : un site qui le bloque n’apparaît pas dans les réponses de recherche | Oui |
| OpenAI | ChatGPT-User | Pages ouvertes à la demande d’un utilisateur | Pas garanti, selon OpenAI |
| Anthropic | ClaudeBot | Collecte pouvant servir à l’entraînement | Oui (y compris Crawl-delay) |
| Anthropic | Claude-SearchBot | Qualité des résultats de recherche | Oui |
| Anthropic | Claude-User | Pages ouvertes à la demande d’un utilisateur | Oui, selon Anthropic |
| Perplexity | PerplexityBot | Affichage et liens dans les résultats, pas d’entraînement de modèles | Oui |
| Perplexity | Perplexity-User | Pages ouvertes à la demande d’un utilisateur | En général non, selon Perplexity |
Google-Extended | Jeton de contrôle pour l’entraînement et l’ancrage de Gemini, sans effet sur Google Search | Oui | |
| Apple | Applebot-Extended | Refus d’utiliser pour les modèles Apple ce qu’Applebot a collecté (ne visite aucune page) | Oui |
| Meta | meta-externalagent | Entraînement et amélioration des produits | Oui |
| Common Crawl | CCBot | Corpus web ouvert, très utilisé pour entraîner les modèles | Oui |
| Microsoft | bingbot | Index Bing, qui alimente aussi Copilot | Oui |
Deux enseignements. D’abord, les robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, bingbot) sont ceux qui décident si vous pouvez être cité : ce sont eux qu’un site B2B doit laisser passer. Ensuite, les robots déclenchés par un utilisateur peuvent ignorer robots.txt : ce fichier est une convention, pas une protection.
Le cas Google : Google-Extended ne suffit pas
La documentation de Google Search est explicite : Google-Extended n’a aucun effet sur l’inclusion dans la recherche Google ni sur le classement. Les fonctionnalités d’IA de la recherche (AI Overviews, AI Mode) reposent sur Googlebot. Pour limiter la reprise d’un contenu dans ces réponses, il faut agir sur les extraits : nosnippet, data-nosnippet, max-snippet, ou noindex.
À l’inverse, bloquer Google-Extended coupe aussi l’ancrage (grounding) de Gemini sur votre site : un site qui veut être cité comme source dans l’application Gemini a intérêt à le laisser ouvert.
Une règle de syntaxe qui piège tout le monde
La RFC 9309, qui normalise robots.txt, prévoit qu’un robot suit le groupe qui le nomme et, seulement s’il n’en trouve aucun, le groupe User-agent: *. Conséquence : dès que vous créez un groupe User-agent: GPTBot, GPTBot ignore vos règles générales. Recopiez-y les Disallow communs (administration, recherche interne…).
Pour une même URL, c’est la règle la plus longue (la plus précise) qui l’emporte ; à égalité, Allow gagne.
Le robots.txt de ce site
DigitalCrafting veut être cité par les assistants. Le robots.txt, généré par l’extension du site, autorise donc explicitement les robots d’IA tout en excluant l’administration, la recherche interne et les sous-sites du réseau (extrait simplifié) :
# Résumé du site pour les assistants IA : https://digitalcrafting.tech/llms.txt
User-agent: *
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /search/
# (+ une ligne Disallow par sous-site du réseau)
Allow: /wp-admin/admin-ajax.php
# Moteurs de réponse et assistants IA : bienvenus.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Google-Extended
User-agent: Applebot-Extended
# (…)
Allow: /
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /search/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://digitalcrafting.tech/wp-sitemap.xml
Si vous préférez refuser l’entraînement mais rester citable, remplacez Allow: / par Disallow: / pour GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent et CCBot, et gardez ouverts OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot et bingbot.
Derrière Cloudflare : vérifiez ce qui est vraiment servi
Cloudflare bloque les robots d’IA par défaut pour les nouveaux domaines depuis juillet 2025, et propose un robots.txt géré qui ajoute ses propres lignes avant les vôtres : des Disallow pour les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot…) et des signaux de contenu (Content Signals). En 2026, le réglage unique « Block AI bots » a laissé place à des catégories (recherche, agent, entraînement) dans AI Crawl Control.
Surtout, un Allow dans robots.txt ne sert à rien si le pare-feu de Cloudflare bloque le robot avant qu’il n’arrive au site. Après toute mise en place, ouvrez votresite/robots.txt dans un navigateur et relisez les réglages de bots de Cloudflare.
Retour d’expérience
En passant ce site derrière Cloudflare, mes propres appels à l’API WordPress ont été rejetés (erreur 1010, signature de navigateur refusée). Même famille de réglages que ceux qui filtrent les robots : testez aussi vos outils et intégrations après chaque changement.
Questions fréquentes
Bloquer GPTBot empêche-t-il ChatGPT de citer mon site ?
Non. GPTBot sert à l’entraînement. La citation dans la recherche de ChatGPT dépend d’OAI-SearchBot. On peut bloquer le premier et autoriser le second.
Bloquer Google-Extended retire-t-il mon site des AI Overviews ?
Non. Selon Google, Google-Extended n’a aucun effet sur la recherche. Les AI Overviews reposent sur Googlebot ; pour limiter la reprise, il faut utiliser nosnippet, max-snippet ou noindex.
robots.txt protège-t-il vraiment mon contenu ?
Non. C’est une convention que chaque robot choisit de respecter. Certains agents déclenchés par un utilisateur peuvent l’ignorer. Pour protéger réellement un contenu, il faut une authentification ou un blocage au niveau du pare-feu.
Sources
- OpenAI — Overview of OpenAI crawlers
- Anthropic — Crawling du web et blocage de ses robots
- Perplexity — Perplexity Crawlers
- Google — Robots d’exploration courants (Google-Extended)
- Google — Fonctionnalités d’IA et votre site
- Apple — À propos d’Applebot
- Meta — Web crawlers
- Common Crawl — CCBot
- Cloudflare — Managed robots.txt
- Cloudflare — AI Crawl Control
- Cloudflare — Content Independence Day (blocage par défaut, juillet 2025)
- RFC 9309 — Robots Exclusion Protocol
Documentation consultée le 25 septembre 2026. Les noms et rôles des robots évoluent : revérifiez la page de chaque éditeur avant de modifier votre fichier.