L’essentiel
GPTBot est le robot d’exploration d’OpenAI qui collecte des contenus pour entraîner ses modèles. Il respecte robots.txt. Le bloquer ne retire pas votre site de la recherche de ChatGPT, qui passe par un autre robot, OAI-SearchBot. Chaque éditeur d’IA sépare ainsi entraînement, index de recherche et visites demandées par un utilisateur : on arbitre robot par robot.
- Trois familles de robots IA : entraînement, index de recherche, récupération à la demande d’un utilisateur.
- Google-Extended n’est pas un robot : c’est un jeton robots.txt, sans effet sur la recherche Google.
- Le CDN peut bloquer un robot avant qu’il lise robots.txt : Cloudflare a changé ses réglages par défaut le 15/09/2026.
Qu’est-ce que GPTBot ?
GPTBot est le robot d’OpenAI chargé de collecter des pages web pouvant servir à l’entraînement de ses modèles d’IA générative. OpenAI le décrit comme un outil pour rendre ses modèles « plus utiles et plus sûrs » (OpenAI, Overview of OpenAI Crawlers). Il s’identifie avec la mention GPTBot dans sa chaîne user-agent et respecte les règles de robots.txt.
Point souvent mal compris : GPTBot n’alimente pas la recherche de ChatGPT. Ce rôle revient à OAI-SearchBot. OpenAI précise que les deux réglages sont indépendants. Un site peut autoriser OAI-SearchBot pour apparaître dans la recherche et refuser GPTBot. Si les deux sont autorisés, OpenAI peut utiliser une seule exploration pour les deux usages.
Définition
Un robot IA (ou crawler IA) est un programme automatisé qui visite des pages web pour le compte d’un éditeur d’intelligence artificielle. Il peut servir à entraîner un modèle, à alimenter l’index d’un moteur de réponse ou à lire une page à la demande d’un utilisateur.
Quels sont les principaux robots IA et à quoi servent-ils ?
Chaque grand éditeur distingue désormais plusieurs robots. Le tableau ci-dessous reprend leur documentation officielle, consultée le 24/09/2026. Les noms changent souvent : revérifiez sur la page de l’éditeur avant toute modification.
| Éditeur | Entraînement | Index de recherche | Récupération à la demande |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User (robots.txt peut ne pas s’appliquer) |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Perplexity | Aucun robot d’entraînement déclaré | PerplexityBot | Perplexity-User (ignore en général robots.txt) |
Jeton Google-Extended (pas un robot) | Googlebot, qui alimente aussi AI Overviews et AI Mode | Non concerné ici |
Anthropic : ClaudeBot et ses deux compagnons
Anthropic décrit trois robots (Anthropic, article d’aide mis à jour le 07/04/2026). Bloquer ClaudeBot signale que vos contenus futurs doivent être exclus des jeux d’entraînement. Bloquer Claude-User empêche Claude de récupérer votre page quand un utilisateur pose une question. Bloquer Claude-SearchBot empêche l’indexation de vos contenus pour sa recherche. Anthropic précise aussi que les règles s’appliquent sous-domaine par sous-domaine.
Perplexity : un index, pas d’entraînement déclaré
Perplexity indique que PerplexityBot sert à faire apparaître et lier des sites dans ses résultats. Il n’est pas utilisé pour entraîner des modèles de fondation. Perplexity-User, lui, visite une page quand un utilisateur pose une question. L’éditeur précise qu’il ignore en général robots.txt, puisque la visite est demandée par une personne (Perplexity, documentation des robots).
Google : Google-Extended n’est pas un robot
Google-Extended ne dispose d’aucune chaîne user-agent propre : il s’agit d’un jeton lu dans robots.txt. Il contrôle l’usage de vos contenus pour entraîner les futurs modèles Gemini et pour l’ancrage (grounding) dans les applications Gemini et l’API Vertex AI. Google précise qu’il n’a aucune incidence sur l’inclusion dans la recherche et n’est pas un signal de classement (Google Search Central, robots d’exploration courants). Les AI Overviews de Google et AI Mode reposent, eux, sur Googlebot.
Faut-il bloquer GPTBot et les robots d’entraînement ?
C’est une décision de politique de contenu, à prendre par écrit avec la direction. Elle se raisonne famille par famille.
| Famille | Effet d’un blocage | Recommandation par défaut |
|---|---|---|
| Entraînement (GPTBot, ClaudeBot, Google-Extended) | Vos contenus sortent des futurs corpus. Aucun retour direct mesurable, effet de long terme sur ce que le modèle sait de vous | Choix éditorial : bloquer si vos contenus sont votre produit (média, données payantes) |
| Index de recherche (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot) | Vos pages ne peuvent plus être citées comme sources par ces moteurs | Autoriser si la visibilité IA fait partie de vos objectifs |
| Récupération à la demande (ChatGPT-User, Claude-User, Perplexity-User) | Un utilisateur ne peut plus faire lire votre page par l’assistant | Autoriser : c’est une personne qui demande la page |
Une marque qui veut être citée par ChatGPT doit au minimum laisser passer OAI-SearchBot. Notre article sur le référencement ChatGPT détaille les autres leviers.
Comment autoriser ou bloquer les robots IA dans robots.txt ?
La syntaxe est celle de tout robots.txt : un groupe de règles pour un ou plusieurs user-agents. Exemple d’une politique « recherche oui, entraînement non » :
# Moteurs de réponse : autorisés
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
# Entraînement : refusé
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
- OpenAI indique un délai d’environ 24 heures pour prendre en compte une modification de robots.txt ;
- chaque sous-domaine a son propre robots.txt : vérifiez-les tous ;
- un
Disallowhérité d’une ancienne politique peut bloquer un robot de recherche sans que personne ne le sache.
Les règles générales de syntaxe, de priorité et de test sont détaillées dans notre guide du fichier robots.txt. Le fichier llms.txt, souvent cité à ce stade, ne bloque ni n’autorise aucun robot : voir notre analyse du fichier llms.txt.
Pourquoi robots.txt ne suffit pas : la couche CDN
Un CDN ou un pare-feu applicatif peut refuser un robot avant qu’il ne lise robots.txt. C’est le point aveugle le plus fréquent en audit. Chez Cloudflare, trois étapes se sont succédé.
- 01/07/2025 : blocage des robots IA par défaut pour les nouveaux domaines (communiqué Cloudflare) et lancement de pay per crawl, qui permet de facturer l’exploration (Cloudflare, pay per crawl).
- 24/09/2025 : signaux de contenu dans robots.txt (
search,ai-input,ai-train), des préférences déclaratives sans force technique (Cloudflare, Content Signals Policy). - 15/09/2026 : nouveaux réglages par défaut pour les nouveaux domaines. Robots d’entraînement et agents bloqués sur les pages qui affichent de la publicité, robots de recherche autorisés (Cloudflare, annonce du 01/07/2026).
Attention
Ces réglages par défaut visent les nouveaux domaines. Ils dépendent du type de robot et de la présence de publicité. N’affirmez jamais « Cloudflare bloque tout par défaut » : ouvrez le tableau de bord et constatez le réglage réel du compte.
Comment vérifier que les robots IA visitent votre site ?
La lecture de robots.txt dit ce qui est permis, pas ce qui se passe. Trois contrôles complètent le diagnostic.
- Journaux serveur : filtrez les user-agents GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, et relevez pages visitées et codes réponse. Méthode détaillée dans notre guide d’analyse de logs.
- Plages d’adresses IP : OpenAI publie les plages de chacun de ses robots au format JSON. Une visite qui se dit GPTBot hors de ces plages est un imposteur.
- Test d’accès réel : une requête avec le user-agent du robot montre la réponse du CDN (code 200 ou blocage).
Google-Extended n’apparaît jamais dans les logs, puisqu’il ne s’agit pas d’un robot. Pour suivre ensuite l’effet de ces réglages sur les citations, voyez notre page pour mesurer la visibilité IA. La stratégie d’ensemble est dans notre guide du GEO.
Questions fréquentes
Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?
Non. GPTBot sert à l’entraînement. La recherche de ChatGPT repose sur OAI-SearchBot, que vous pouvez autoriser séparément. OpenAI indique que les deux réglages sont indépendants.
Quelle différence entre GPTBot et ChatGPT-User ?
GPTBot explore le web de façon automatique pour l’entraînement. ChatGPT-User visite une page parce qu’un utilisateur l’a demandé dans ChatGPT ou dans un GPT personnalisé. OpenAI précise que robots.txt peut alors ne pas s’appliquer.
Bloquer Google-Extended retire-t-il mon site des AI Overviews ?
Non. Google indique que Google-Extended n’a aucune incidence sur l’inclusion dans la recherche. AI Overviews et AI Mode s’appuient sur Googlebot. Google-Extended concerne l’entraînement de Gemini et l’ancrage dans Gemini et Vertex AI.
Comment savoir si ClaudeBot visite mon site ?
Filtrez vos journaux serveur sur le user-agent ClaudeBot et relevez les pages visitées et les codes réponse. Vérifiez aussi que votre CDN ne le bloque pas avant la lecture de robots.txt.
Sources
- OpenAI, Overview of OpenAI Crawlers, documentation non datée. Consulté le 24/09/2026.
- Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?, mis à jour le 07/04/2026. Consulté le 24/09/2026.
- Perplexity, Perplexity Crawlers, documentation non datée. Consulté le 24/09/2026.
- Google Search Central, Robots d’exploration courants de Google. Consulté le 24/09/2026.
- Cloudflare, Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large, communiqué du 01/07/2025. Consulté le 24/09/2026.
- Cloudflare, Introducing pay per crawl, publié le 01/07/2025. Consulté le 24/09/2026.
- Cloudflare, Content Signals Policy, publié le 24/09/2025. Consulté le 24/09/2026.
- Cloudflare, Your site, your rules: new AI traffic options for all customers, publié le 01/07/2026. Consulté le 24/09/2026.




