GEO & marketingDossierÉtat au 25 septembre 2026

robots.txt et robots des IA : GPTBot, ClaudeBot, PerplexityBot… qui autoriser ?

Chaque éditeur d’IA a désormais un robot pour l’entraînement et un autre pour la recherche. Le tableau des user-agents, ce que chacun respecte, et le robots.txt d’un site B2B qui veut être cité.

En bref

  • Les grands éditeurs séparent désormais leurs robots : un pour l’entraînement des modèles, un pour la recherche et la citation, parfois un troisième pour les visites déclenchées par un utilisateur.
  • On peut donc refuser l’entraînement tout en restant citable dans ChatGPT, Claude ou Perplexity.
  • Bloquer Google-Extended ne retire pas un site des AI Overviews de Google : ceux-ci dépendent de Googlebot.
  • Derrière Cloudflare, vérifiez le robots.txt réellement servi et les réglages « AI Crawl Control » : ils peuvent bloquer ce que votre robots.txt autorise.

Pour un site B2B, être repris et cité par les assistants IA devient un canal d’acquisition à part entière : c’est l’objet du GEO (Generative Engine Optimization). Le premier réglage se fait dans un fichier vieux de trente ans : robots.txt. Encore faut-il savoir à qui l’on parle.

Le tableau des robots, d’après la documentation des éditeurs

ÉditeurUser-agentRôleRespecte robots.txt
OpenAIGPTBotEntraînement des modèlesOui
OpenAIOAI-SearchBotRecherche de ChatGPT : un site qui le bloque n’apparaît pas dans les réponses de rechercheOui
OpenAIChatGPT-UserPages ouvertes à la demande d’un utilisateurPas garanti, selon OpenAI
AnthropicClaudeBotCollecte pouvant servir à l’entraînementOui (y compris Crawl-delay)
AnthropicClaude-SearchBotQualité des résultats de rechercheOui
AnthropicClaude-UserPages ouvertes à la demande d’un utilisateurOui, selon Anthropic
PerplexityPerplexityBotAffichage et liens dans les résultats, pas d’entraînement de modèlesOui
PerplexityPerplexity-UserPages ouvertes à la demande d’un utilisateurEn général non, selon Perplexity
GoogleGoogle-ExtendedJeton de contrôle pour l’entraînement et l’ancrage de Gemini, sans effet sur Google SearchOui
AppleApplebot-ExtendedRefus d’utiliser pour les modèles Apple ce qu’Applebot a collecté (ne visite aucune page)Oui
Metameta-externalagentEntraînement et amélioration des produitsOui
Common CrawlCCBotCorpus web ouvert, très utilisé pour entraîner les modèlesOui
MicrosoftbingbotIndex Bing, qui alimente aussi CopilotOui

Deux enseignements. D’abord, les robots de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, bingbot) sont ceux qui décident si vous pouvez être cité : ce sont eux qu’un site B2B doit laisser passer. Ensuite, les robots déclenchés par un utilisateur peuvent ignorer robots.txt : ce fichier est une convention, pas une protection.

Le cas Google : Google-Extended ne suffit pas

La documentation de Google Search est explicite : Google-Extended n’a aucun effet sur l’inclusion dans la recherche Google ni sur le classement. Les fonctionnalités d’IA de la recherche (AI Overviews, AI Mode) reposent sur Googlebot. Pour limiter la reprise d’un contenu dans ces réponses, il faut agir sur les extraits : nosnippet, data-nosnippet, max-snippet, ou noindex.

À l’inverse, bloquer Google-Extended coupe aussi l’ancrage (grounding) de Gemini sur votre site : un site qui veut être cité comme source dans l’application Gemini a intérêt à le laisser ouvert.

Une règle de syntaxe qui piège tout le monde

La RFC 9309, qui normalise robots.txt, prévoit qu’un robot suit le groupe qui le nomme et, seulement s’il n’en trouve aucun, le groupe User-agent: *. Conséquence : dès que vous créez un groupe User-agent: GPTBot, GPTBot ignore vos règles générales. Recopiez-y les Disallow communs (administration, recherche interne…).

Pour une même URL, c’est la règle la plus longue (la plus précise) qui l’emporte ; à égalité, Allow gagne.

Le robots.txt de ce site

DigitalCrafting veut être cité par les assistants. Le robots.txt, généré par l’extension du site, autorise donc explicitement les robots d’IA tout en excluant l’administration, la recherche interne et les sous-sites du réseau (extrait simplifié) :

# Résumé du site pour les assistants IA : https://digitalcrafting.tech/llms.txt

User-agent: *
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /search/
# (+ une ligne Disallow par sous-site du réseau)
Allow: /wp-admin/admin-ajax.php

# Moteurs de réponse et assistants IA : bienvenus.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Google-Extended
User-agent: Applebot-Extended
# (…)
Allow: /
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /search/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://digitalcrafting.tech/wp-sitemap.xml

Si vous préférez refuser l’entraînement mais rester citable, remplacez Allow: / par Disallow: / pour GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent et CCBot, et gardez ouverts OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot et bingbot.

Derrière Cloudflare : vérifiez ce qui est vraiment servi

Cloudflare bloque les robots d’IA par défaut pour les nouveaux domaines depuis juillet 2025, et propose un robots.txt géré qui ajoute ses propres lignes avant les vôtres : des Disallow pour les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot…) et des signaux de contenu (Content Signals). En 2026, le réglage unique « Block AI bots » a laissé place à des catégories (recherche, agent, entraînement) dans AI Crawl Control.

Surtout, un Allow dans robots.txt ne sert à rien si le pare-feu de Cloudflare bloque le robot avant qu’il n’arrive au site. Après toute mise en place, ouvrez votresite/robots.txt dans un navigateur et relisez les réglages de bots de Cloudflare.

Retour d’expérience

En passant ce site derrière Cloudflare, mes propres appels à l’API WordPress ont été rejetés (erreur 1010, signature de navigateur refusée). Même famille de réglages que ceux qui filtrent les robots : testez aussi vos outils et intégrations après chaque changement.

Questions fréquentes

Bloquer GPTBot empêche-t-il ChatGPT de citer mon site ?

Non. GPTBot sert à l’entraînement. La citation dans la recherche de ChatGPT dépend d’OAI-SearchBot. On peut bloquer le premier et autoriser le second.

Bloquer Google-Extended retire-t-il mon site des AI Overviews ?

Non. Selon Google, Google-Extended n’a aucun effet sur la recherche. Les AI Overviews reposent sur Googlebot ; pour limiter la reprise, il faut utiliser nosnippet, max-snippet ou noindex.

robots.txt protège-t-il vraiment mon contenu ?

Non. C’est une convention que chaque robot choisit de respecter. Certains agents déclenchés par un utilisateur peuvent l’ignorer. Pour protéger réellement un contenu, il faut une authentification ou un blocage au niveau du pare-feu.

L'auteur

François Legrand

Je fabrique des modules Odoo sur mesure, des intégrations entre logiciels et des sites WordPress.

Besoin d’un outil ?

Des outils qui ne se parlent pas ?

Je relie votre ERP, votre emailing, votre mesure d’audience et votre site.

Voir l’offre intégrations