Bienvenue sur le nouveau site d’Elev8 Lab : des guides SEO, GEO et acquisition, testés et sourcés. Découvrir les guides

EN, English version
Accueil / Blog / SEO / Robots.txt : le guide pratique pour le SEO

Robots.txt : le guide pratique pour le SEO

Le fichier robots.txt tient en quelques lignes, mais une seule erreur peut fermer un site entier à Google. Il indique aux robots ce qu’ils peuvent explorer, sans jamais garantir qu’une page reste hors de l’index. Depuis l’arrivée des moteurs de réponse, il sert aussi à décider quels robots d’IA peuvent lire vos contenus, pour l’entraînement ou pour la citation. Ce guide reprend les règles telles que Google les applique en 2026, la différence avec la balise noindex, un exemple adapté à WordPress, les arbitrages sur GPTBot, OAI-SearchBot ou ClaudeBot, et la méthode pour tester le fichier depuis la Search Console.

L’essentiel

Le robots.txt est un fichier texte placé à la racine d’un site. Il indique aux robots d’exploration les URL qu’ils peuvent parcourir ou non. Il contrôle l’exploration, pas l’indexation : une page bloquée peut quand même apparaître dans Google. C’est aussi le fichier qui ouvre ou ferme votre site aux robots des IA.

  • Quatre directives comptent pour Google : User-agent, Disallow, Allow et Sitemap.
  • Pour retirer une page de Google, utilisez noindex, jamais le robots.txt.
  • Bloquer GPTBot n’a pas le même effet que bloquer OAI-SearchBot : l’un vise l’entraînement, l’autre la citation dans ChatGPT.

Qu’est-ce qu’un fichier robots.txt ?

Le fichier robots.txt applique le protocole d’exclusion des robots, né en 1994. Ce protocole est devenu une norme de l’IETF en septembre 2022 : la RFC 9309, coécrite par des ingénieurs de Google. Un robot respectueux lit ce fichier avant d’explorer un site, puis suit ses règles.

Selon Google, il sert à gérer le trafic des robots sur votre site (introduction au robots.txt, 10/12/2025). Il évite de surcharger le serveur ou d’explorer des pages sans intérêt. Ce n’est ni un outil de sécurité, ni un moyen de sortir une page de Google.

Où se trouve le robots.txt d’un site ?

Toujours à la racine de l’hôte : https://www.exemple.fr/robots.txt. Il suffit de taper cette adresse pour lire celui de n’importe quel site. Il ne vaut que pour l’hôte, le protocole et le port où il est publié. blog.exemple.fr ou la version http ont besoin de leur propre fichier.

Ce que Google fait selon la réponse du serveur

Réponse du fichierComportement de Google
200Google lit et applique les règles. Il garde le fichier en cache jusqu’à 24 heures en général.
404 ou autre 4xx (sauf 429)Google considère qu’il n’existe aucune restriction et explore tout.
5xx ou serveur injoignableGoogle arrête d’explorer pendant 12 heures, puis s’appuie sur la dernière version en cache pendant 30 jours tout en réessayant.
Fichier de plus de 500 KioTout ce qui dépasse la limite est ignoré.
Source : interprétation du robots.txt par Google, documentation mise à jour le 31/08/2026.

Ces règles viennent de la spécification du robots.txt publiée par Google (mise à jour le 31/08/2026). Un robots.txt qui renvoie une erreur serveur est donc plus dangereux qu’un fichier absent.

Quelles directives Google comprend-il ?

DirectiveRôleExemple
User-agentDésigne le robot visé ; * vise tous ceux qui n’ont pas de groupe dédiéUser-agent: Googlebot
DisallowInterdit l’exploration d’un cheminDisallow: /panier/
AllowAutorise un chemin à l’intérieur d’une zone interditeAllow: /panier/aide/
SitemapDéclare l’URL absolue d’un sitemap, hors de tout groupeSitemap: https://www.exemple.fr/sitemap.xml
  • * remplace n’importe quelle suite de caractères et $ marque la fin de l’URL : Disallow: /*.pdf$ bloque les PDF.
  • Les chemins sont sensibles à la casse : /Admin/ et /admin/ sont deux règles distinctes.
  • En cas de conflit, Google applique la règle la plus spécifique (le chemin le plus long) ; à égalité, la moins restrictive.
  • Google ignore Crawl-delay. D’autres robots, comme ceux d’Anthropic, le prennent en compte.
# Exemple commenté
User-agent: *
Disallow: /recherche/
Disallow: /*?tri=
Allow: /recherche/aide/

Sitemap: https://www.exemple.fr/sitemap.xml

Robots.txt ou noindex : lequel utiliser ?

C’est l’erreur la plus fréquente. Le robots.txt empêche le robot de lire la page ; il ne l’empêche pas de connaître son adresse. Si d’autres sites y renvoient, Google peut afficher l’URL sans description (introduction de Google citée plus haut).

ObjectifBon outilPourquoi
Ne pas faire explorer des zones sans intérêt (tri, recherche interne, panier)robots.txtÉconomise l’exploration, surtout sur un grand site
Retirer une page de l’index GoogleBalise noindex ou en-tête X-Robots-TagGoogle doit pouvoir explorer la page pour lire la consigne
Protéger une préproduction ou un espace clientMot de passe (authentification serveur)Le robots.txt est public et certains robots l’ignorent

Attention

Ne combinez jamais noindex et Disallow sur la même page. Bloquée par le robots.txt, la page n’est plus lue. Google ne voit pas le noindex et l’URL peut rester indexée. Retirez d’abord la page de l’index avec noindex, et seulement ensuite bloquez l’exploration si besoin. Plus de détails dans notre article sur l’indexation Google.

Sur un grand site, Google recommande le robots.txt pour bloquer durablement les URL qui ne doivent jamais être explorées. C’est le sujet du budget crawl.

Comment gérer l’accès des robots IA dans le robots.txt ?

Les éditeurs d’IA publient désormais plusieurs robots, avec des rôles distincts. Les bloquer tous d’un bloc revient souvent à sortir des réponses de ChatGPT ou de Claude sans le vouloir. Trois familles sont à distinguer.

FamilleRobots (au 24/09/2026)Effet d’un blocage
Entraînement des modèlesGPTBot (OpenAI), ClaudeBot (Anthropic), jeton Google-ExtendedVos futurs contenus sortent des données d’entraînement
Index des moteurs de réponseOAI-SearchBot (ChatGPT), Claude-SearchBot, Googlebot (qui alimente aussi AI Overviews et AI Mode)Vos pages ne peuvent plus être citées comme source
Lecture à la demande d’un utilisateurChatGPT-User, Claude-UserL’assistant ne peut plus lire la page à la demande ; OpenAI précise que ChatGPT-User peut ne pas suivre ces règles

Trois précisions tirées de la documentation des éditeurs. Chez OpenAI, OAI-SearchBot fait apparaître des sites dans la recherche de ChatGPT. Les règles du robots.txt peuvent en revanche ne pas s’appliquer à ChatGPT-User, dont la visite est déclenchée par un utilisateur (OpenAI, documentation des robots). Anthropic décrit ses trois robots, respecte le robots.txt et accepte Crawl-delay (Anthropic, centre d’aide). Enfin, Google-Extended n’est pas un robot mais un jeton. Il règle l’usage de vos contenus pour Gemini, sans effet sur votre présence ni votre classement dans Google (Google, liste des robots, 14/07/2026).

Exemple d’arbitrage fréquent : rester citable par les moteurs de réponse, sans alimenter l’entraînement.

# Refuser l'entraînement, rester citable
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow: /recherche/

Sitemap: https://www.exemple.fr/sitemap.xml

Regardez aussi la couche CDN

Le robots.txt n’est pas le seul filtre. Cloudflare a redéfini ses réglages par défaut le 01/07/2026 (Cloudflare, 01/07/2026). Depuis le 15/09/2026, sur les nouveaux domaines, les robots d’entraînement et les agents IA sont bloqués par défaut sur les pages qui affichent de la publicité. Les robots de recherche restent autorisés. Vérifiez le réglage réel de votre CDN, pas seulement votre fichier.

Ces arbitrages sont détaillés, robot par robot, dans notre article sur les robots des IA. À noter : le fichier llms.txt ne bloque ni n’autorise aucun robot ; seul le robots.txt joue ce rôle.

Quel robots.txt pour un site WordPress ?

WordPress sert un robots.txt virtuel tant qu’aucun fichier physique n’existe à la racine. Depuis la version 5.5, il y déclare son sitemap natif. Un fichier robots.txt déposé à la racine remplace cette version virtuelle. Certaines extensions SEO permettent aussi de l’éditer depuis l’administration.

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /search/

Sitemap: https://www.exemple.fr/wp-sitemap.xml

Deux règles à respecter. Ne bloquez jamais /wp-content/ ni /wp-includes/ en entier. Les feuilles de style, scripts et images en dépendent, et Google en a besoin pour afficher la page comme un visiteur. Et adaptez la ligne Sitemap à l’extension utilisée : l’index de Yoast SEO, par exemple, est sitemap_index.xml. Voir notre article sur le sitemap XML.

Comment tester et surveiller son robots.txt ?

L’ancien outil de test du robots.txt de la Search Console n’existe plus. Il est remplacé par le rapport robots.txt, dans Paramètres, puis Exploration. Il montre la version récupérée par Google, la date de récupération et les erreurs éventuelles. Voir notre guide Google Search Console.

  1. Vérifier la réponse : curl -I https://www.exemple.fr/robots.txt doit renvoyer 200.
  2. Lire le rapport robots.txt de la Search Console après chaque modification.
  3. Inspecter une URL stratégique avec l’outil d’inspection : elle ne doit pas être signalée comme bloquée.
  4. Crawler le site avec un outil qui respecte le robots.txt, pour lister les URL bloquées et repérer une page importante parmi elles.
  5. Contrôler à chaque mise en ligne : un Disallow: / hérité de la préproduction est l’erreur classique d’une migration SEO.

Le robots.txt fait partie des premiers contrôles d’un chantier de SEO technique. Il est court, mais une seule ligne peut fermer tout le site.

Questions fréquentes

C’est quoi le robots.txt ?

C’est un fichier texte public, placé à la racine d’un site. Il dit aux robots d’exploration quelles parties du site ils peuvent parcourir. Il suit le protocole d’exclusion des robots, normalisé en 2022 sous le nom de RFC 9309. Il gère l’exploration, pas l’indexation.

Comment trouver le robots.txt d’un site ?

Ajoutez /robots.txt après le nom de domaine, par exemple https://www.exemple.fr/robots.txt. Une erreur 404 signifie que le site n’a pas de fichier : les robots considèrent alors que tout est autorisé.

C’est quoi Googlebot ?

Googlebot est le robot d’exploration de Google Search. Il télécharge les pages pour les indexer et alimente aussi AI Overviews et AI Mode. Il existe en version smartphone et ordinateur ; c’est la version smartphone qui explore la plupart des sites.

Le robots.txt protège-t-il des pages privées ?

Non. Le fichier est public, il signale même aux curieux les zones que vous voulez cacher, et certains robots l’ignorent. Une page privée se protège par un mot de passe ou une authentification serveur.

Faut-il bloquer GPTBot ?

C’est un choix d’entreprise. Bloquer GPTBot retire vos futurs contenus de l’entraînement des modèles d’OpenAI, sans empêcher la citation dans ChatGPT, qui dépend d’OAI-SearchBot. Décidez robot par robot, et notez la décision.

Sources

  1. IETF, RFC 9309, Robots Exclusion Protocol, publiée en septembre 2022. Consulté le 24/09/2026.
  2. Google Search Central, Introduction to robots.txt, mis à jour le 10/12/2025. Consulté le 24/09/2026.
  3. Google Search Central, How Google interprets the robots.txt specification, mis à jour le 31/08/2026. Consulté le 24/09/2026.
  4. Google Crawling Infrastructure, Google’s common crawlers (Google-Extended), mis à jour le 14/07/2026. Consulté le 24/09/2026.
  5. OpenAI, Overview of OpenAI crawlers. Consulté le 24/09/2026.
  6. Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler? Consulté le 24/09/2026.
  7. Cloudflare, Your site, your rules: new AI traffic options for all customers, publié le 01/07/2026. Consulté le 24/09/2026.
Avatar de Baptiste Clair

Consultant marketing digital, SEO et GEO

En savoir plus sur l'auteur

Article vérifié et mis à jour par l'auteur. Sources consultées à la date indiquée.

Citer cet article

Clair, B. (2026, 24 septembre). Robots.txt : le guide pratique pour le SEO. Elev8 Lab. https://elev8-lab.fr/seo/robots-txt-seo/