---
title: "robots.txt et robots des IA : GPTBot, ClaudeBot, PerplexityBot… qui autoriser ?"
url: "https://digitalcrafting.tech/veille/robots-txt-robots-ia/"
description: "robots.txt et IA : GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended… Qui fait quoi, qui respecte robots.txt, et quel réglage pour être cité par les assistants."
published: "2026-09-25"
updated: "2026-09-25"
author: "François Legrand"
site: "DigitalCrafting"
rubrique: "GEO & marketing"
---

# robots.txt et robots des IA : GPTBot, ClaudeBot, PerplexityBot… qui autoriser ?

> robots.txt et IA : GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended… Qui fait quoi, qui respecte robots.txt, et quel réglage pour être cité par les assistants.

En bref

- Les grands éditeurs séparent désormais leurs robots : un pour **l’entraînement** des modèles, un pour la **recherche et la citation**, parfois un troisième pour les visites déclenchées par un utilisateur.
- On peut donc refuser l’entraînement tout en restant citable dans ChatGPT, Claude ou Perplexity.
- Bloquer `Google-Extended` ne retire pas un site des AI Overviews de Google : ceux-ci dépendent de Googlebot.
- Derrière Cloudflare, vérifiez le robots.txt réellement servi et les réglages « AI Crawl Control » : ils peuvent bloquer ce que votre robots.txt autorise.

Pour un site B2B, être repris et cité par les assistants IA devient un canal d’acquisition à part entière : c’est l’objet du GEO (*Generative Engine Optimization*). Le premier réglage se fait dans un fichier vieux de trente ans : `robots.txt`. Encore faut-il savoir à qui l’on parle.

## Le tableau des robots, d’après la documentation des éditeurs

| Éditeur | User-agent | Rôle | Respecte robots.txt |
| --- | --- | --- | --- |
| OpenAI | `GPTBot` | Entraînement des modèles | Oui |
| OpenAI | `OAI-SearchBot` | Recherche de ChatGPT : un site qui le bloque n’apparaît pas dans les réponses de recherche | Oui |
| OpenAI | `ChatGPT-User` | Pages ouvertes à la demande d’un utilisateur | Pas garanti, selon OpenAI |
| Anthropic | `ClaudeBot` | Collecte pouvant servir à l’entraînement | Oui (y compris `Crawl-delay`) |
| Anthropic | `Claude-SearchBot` | Qualité des résultats de recherche | Oui |
| Anthropic | `Claude-User` | Pages ouvertes à la demande d’un utilisateur | Oui, selon Anthropic |
| Perplexity | `PerplexityBot` | Affichage et liens dans les résultats, pas d’entraînement de modèles | Oui |
| Perplexity | `Perplexity-User` | Pages ouvertes à la demande d’un utilisateur | En général non, selon Perplexity |
| Google | `Google-Extended` | Jeton de contrôle pour l’entraînement et l’ancrage de Gemini, sans effet sur Google Search | Oui |
| Apple | `Applebot-Extended` | Refus d’utiliser pour les modèles Apple ce qu’Applebot a collecté (ne visite aucune page) | Oui |
| Meta | `meta-externalagent` | Entraînement et amélioration des produits | Oui |
| Common Crawl | `CCBot` | Corpus web ouvert, très utilisé pour entraîner les modèles | Oui |
| Microsoft | `bingbot` | Index Bing, qui alimente aussi Copilot | Oui |

Deux enseignements. D’abord, les robots de **recherche** (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, bingbot) sont ceux qui décident si vous pouvez être cité : ce sont eux qu’un site B2B doit laisser passer. Ensuite, les robots déclenchés par un utilisateur peuvent ignorer robots.txt : ce fichier est une convention, pas une protection.

## Le cas Google : Google-Extended ne suffit pas

La documentation de Google Search est explicite : `Google-Extended` n’a aucun effet sur l’inclusion dans la recherche Google ni sur le classement. Les fonctionnalités d’IA de la recherche (AI Overviews, AI Mode) reposent sur Googlebot. Pour limiter la reprise d’un contenu dans ces réponses, il faut agir sur les extraits : `nosnippet`, `data-nosnippet`, `max-snippet`, ou `noindex`.

À l’inverse, bloquer Google-Extended coupe aussi l’**ancrage** (grounding) de Gemini sur votre site : un site qui veut être cité comme source dans l’application Gemini a intérêt à le laisser ouvert.

## Une règle de syntaxe qui piège tout le monde

La RFC 9309, qui normalise robots.txt, prévoit qu’un robot suit le groupe qui le nomme et, seulement s’il n’en trouve aucun, le groupe `User-agent: *`. Conséquence : dès que vous créez un groupe `User-agent: GPTBot`, GPTBot **ignore** vos règles générales. Recopiez-y les `Disallow` communs (administration, recherche interne…).

Pour une même URL, c’est la règle la plus longue (la plus précise) qui l’emporte ; à égalité, `Allow` gagne.

## Le robots.txt de ce site

DigitalCrafting veut être cité par les assistants. Le robots.txt, généré par l’extension du site, autorise donc explicitement les robots d’IA tout en excluant l’administration, la recherche interne et les sous-sites du réseau (extrait simplifié) :

```
# Résumé du site pour les assistants IA : https://digitalcrafting.tech/llms.txt

User-agent: *
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /search/
# (+ une ligne Disallow par sous-site du réseau)
Allow: /wp-admin/admin-ajax.php

# Moteurs de réponse et assistants IA : bienvenus.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Google-Extended
User-agent: Applebot-Extended
# (…)
Allow: /
Disallow: /wp-admin/
Disallow: /?s=
Disallow: /search/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://digitalcrafting.tech/wp-sitemap.xml
```

Si vous préférez refuser l’entraînement mais rester citable, remplacez `Allow: /` par `Disallow: /` pour GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent et CCBot, et gardez ouverts OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot et bingbot.

## Derrière Cloudflare : vérifiez ce qui est vraiment servi

Cloudflare bloque les robots d’IA par défaut pour les nouveaux domaines depuis juillet 2025, et propose un **robots.txt géré** qui ajoute ses propres lignes *avant* les vôtres : des `Disallow` pour les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot…) et des signaux de contenu (*Content Signals*). En 2026, le réglage unique « Block AI bots » a laissé place à des catégories (recherche, agent, entraînement) dans **AI Crawl Control**.

Surtout, un `Allow` dans robots.txt ne sert à rien si le pare-feu de Cloudflare bloque le robot avant qu’il n’arrive au site. Après toute mise en place, ouvrez `votresite/robots.txt` dans un navigateur et relisez les réglages de bots de Cloudflare.

Retour d’expérience

En passant ce site derrière Cloudflare, mes propres appels à l’API WordPress ont été rejetés (erreur 1010, signature de navigateur refusée). Même famille de réglages que ceux qui filtrent les robots : testez aussi vos outils et intégrations après chaque changement.

## Questions fréquentes

### Bloquer GPTBot empêche-t-il ChatGPT de citer mon site ?

Non. GPTBot sert à l’entraînement. La citation dans la recherche de ChatGPT dépend d’OAI-SearchBot. On peut bloquer le premier et autoriser le second.

### Bloquer Google-Extended retire-t-il mon site des AI Overviews ?

Non. Selon Google, Google-Extended n’a aucun effet sur la recherche. Les AI Overviews reposent sur Googlebot ; pour limiter la reprise, il faut utiliser nosnippet, max-snippet ou noindex.

### robots.txt protège-t-il vraiment mon contenu ?

Non. C’est une convention que chaque robot choisit de respecter. Certains agents déclenchés par un utilisateur peuvent l’ignorer. Pour protéger réellement un contenu, il faut une authentification ou un blocage au niveau du pare-feu.

## Sources

- [OpenAI — Overview of OpenAI crawlers](https://developers.openai.com/api/docs/bots)
- [Anthropic — Crawling du web et blocage de ses robots](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)
- [Perplexity — Perplexity Crawlers](https://docs.perplexity.ai/guides/bots)
- [Google — Robots d’exploration courants (Google-Extended)](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)
- [Google — Fonctionnalités d’IA et votre site](https://developers.google.com/search/docs/appearance/ai-features)
- [Apple — À propos d’Applebot](https://support.apple.com/en-us/119829)
- [Meta — Web crawlers](https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/)
- [Common Crawl — CCBot](https://commoncrawl.org/ccbot)
- [Cloudflare — Managed robots.txt](https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/)
- [Cloudflare — AI Crawl Control](https://developers.cloudflare.com/ai-crawl-control/)
- [Cloudflare — Content Independence Day (blocage par défaut, juillet 2025)](https://blog.cloudflare.com/content-independence-day-no-ai-crawl-without-compensation/)
- [RFC 9309 — Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html)

Documentation consultée le 25 septembre 2026. Les noms et rôles des robots évoluent : revérifiez la page de chaque éditeur avant de modifier votre fichier.

## Pour aller plus loin

- [Sites WordPress](https://digitalcrafting.tech/wordpress/)
- [WordPress multisite : pourquoi ce /blog dans vos permaliens](https://digitalcrafting.tech/veille/wordpress-multisite-prefixe-blog/)
- [Brancher Odoo à un assistant IA avec MCP](https://digitalcrafting.tech/veille/mcp-odoo-assistant-ia/)
