Journal · Agir

Robots d’IA : un robots.txt commenté, robot par robot

Quel robot d’IA fait quoi, et que mettre dans robots.txt : un fichier d’exemple commenté, fondé sur la documentation de chaque éditeur.

Par L’équipe GeoMetrickRelu par Esteban, associé de GeoMetrickPublié le Lecture : environ 8 min

Sommaire de la page
  1. Un groupe par robot, parce que chaque robot a un rôle
  2. Qui fait quoi : le tableau par éditeur
  3. Le fichier robots.txt commenté
  4. Google et Bing : l’affichage dans les réponses IA ne passe pas par ces lignes
  5. Ce qu’un fichier robots.txt n’assure pas
  6. Vérifier après la modification
  7. Ce que nous ne savons pas
  8. Questions fréquentes
  9. Sources
  10. Auteur et journal des modifications
  11. À lire ensuite

Un groupe par robot, parce que chaque robot a un rôle#

Pour régler l’accès des IA à votre site, il faut écrire un groupe robots.txt par robot, car les éditeurs séparent leurs robots par rôle : entraînement, recherche, action demandée par un utilisateur.[1][2] Un même éditeur peut donc avoir un robot que vous acceptez (la recherche) et un robot que vous refusez (l’entraînement).

OpenAI le dit ainsi : ChatGPT-User ne sert pas à décider si un contenu apparaît dans la recherche de ChatGPT, c’est le rôle d’un autre robot.[1] Lire le nom d’un robot ne suffit pas : il faut lire son rôle.

Qui fait quoi : le tableau par éditeur#

Chaque ligne reprend la documentation de l’éditeur, à la date de consultation indiquée dans les sources. Une réserve « aucune » signifie que la page lue n’en mentionne pas.

Robot Éditeur Rôle décrit par l’éditeur Réserve à connaître
OAI-SearchBot OpenAI Recherche de ChatGPT[1] Si GPTBot est aussi autorisé, un seul passage peut servir aux deux usages[5]
GPTBot OpenAI Exploration pouvant servir à l’entraînement[1] Aucune dans la page lue
ChatGPT-User OpenAI Action demandée par un utilisateur de ChatGPT[1] Les règles robots.txt peuvent ne pas s’appliquer[1]
OAI-AdsBot OpenAI Vérification de pages d’annonces, sans entraînement[5] Aucune dans la page lue
ClaudeBot Anthropic Collecte pouvant contribuer à l’entraînement[2] Respecte robots.txt ; Crawl-delay accepté[2][6]
Claude-SearchBot Anthropic Indexation pour la qualité des résultats de recherche[2] Chaîne user-agent complète non publiée[6]
Claude-User Anthropic Récupération quand une personne pose à Claude une question qui le nécessite[2] Chaîne user-agent complète non publiée[6]
PerplexityBot Perplexity Faire apparaître et lier des sites dans les résultats, sans entraînement[4] Perplexity recommande de l’autoriser[7]
Perplexity-User Perplexity Action demandée par un utilisateur[4] Ignore en général robots.txt[4]
MistralAI-Index Mistral AI Indexation pour la recherche de Mistral, sans entraînement[8] Aucune dans la page lue
MistralAI-User Mistral AI Actions d’un utilisateur dans l’application, sans exploration automatique[8] La page lue ne dit pas s’il applique robots.txt[8]
MistralAI-Training Mistral AI Collecte pour constituer des jeux d’entraînement[8] Se refuse par robots.txt[8]
Google-Extended Google Jeton : entraînement des futurs modèles Gemini et ancrage dans Gemini Apps et Vertex AI[9] Sans effet sur Google Search[9]
Meta-WebIndexer Meta Qualité de la recherche de Meta AI[10] Aucune dans la page lue
Meta-ExternalAgent Meta Entraînement de modèles ou amélioration de produits[10] Aucune dans la page lue
Meta-ExternalFetcher Meta Liens récupérés à la demande d’un utilisateur[10] Peut ignorer robots.txt[10]
CCBot Common Crawl Dépôt ouvert de données du web, utilisé pour la recherche et l’entraînement de modèles[11] Respecte robots.txt[11]
Applebot-Extended Apple Jeton de refus de l’usage pour l’entraînement ; n’explore pas[12] Applebot, lui, respecte robots.txt[12]

Deux éditeurs manquent : xAI (Grok) et DeepSeek. Nous n’avons trouvé aucun robot documenté pour eux, et nous n’écrivons aucune ligne à leur place.

Meta décrit aussi Meta-ExternalAds et facebookexternalhit (ce dernier peut ignorer robots.txt pour des contrôles de sécurité ou d’intégrité).[10] Apple décrit Applebot, qui explore pour Spotlight, Siri et Safari.[12] Nous ne les mettons pas dans l’exemple, pas plus qu’OAI-AdsBot et Meta-ExternalFetcher, présents au tableau : lisez leur rôle avant d’ajouter une ligne.

Le fichier robots.txt commenté#

L’exemple ci-dessous suit un choix de départ : autoriser la recherche des IA et les demandes de leurs utilisateurs, et demander que l’entraînement n’utilise pas votre contenu. Ce choix est le vôtre : l’inverse s’écrit en échangeant Allow et Disallow, et aucune source ne dit lequel est préférable pour votre marque.

# robots.txt : exemple commenté, à adapter à votre site.
# Noms de robots relevés le 2 octobre 2026 dans la documentation de chaque éditeur.
#
# Choix de cet exemple : autoriser la recherche des IA et les demandes de leurs
# utilisateurs, demander que l'entraînement n'utilise pas votre contenu.
# Ce choix est le vôtre : pour l'inverse, échangez Allow et Disallow.
#
# Placez ces groupes après vos règles actuelles (Googlebot, Bingbot, etc.).
# Si vous interdisez déjà des dossiers à tous les robots, reportez ces
# interdictions dans chacun des groupes ci-dessous.
#
# xAI (Grok) et DeepSeek : aucun robot documenté trouvé, aucune ligne écrite.
# Robots volontairement absents (lisez leur rôle avant d'en ajouter) :
# OAI-AdsBot, Meta-ExternalAds, Meta-ExternalFetcher, facebookexternalhit, Applebot.

# ---------- OpenAI ----------
# Recherche de ChatGPT : autorisé.
User-agent: OAI-SearchBot
Allow: /

# Exploration pouvant servir à l'entraînement : refusé.
User-agent: GPTBot
Disallow: /

# Action demandée par un utilisateur. OpenAI indique que les règles robots.txt
# peuvent ne pas s'appliquer à ce robot : la ligne exprime votre intention,
# elle n'assure rien.
User-agent: ChatGPT-User
Allow: /

# ---------- Anthropic ----------
# Collecte pouvant contribuer à l'entraînement : refusé.
User-agent: ClaudeBot
Disallow: /

# Indexation pour la recherche : autorisé.
User-agent: Claude-SearchBot
Allow: /

# Récupération demandée par une personne : autorisé.
User-agent: Claude-User
Allow: /

# ---------- Perplexity ----------
# Résultats de recherche, sans entraînement : autorisé (Perplexity le recommande).
User-agent: PerplexityBot
Allow: /

# Action demandée par un utilisateur. Perplexity indique que ce robot ignore en
# général robots.txt : la ligne exprime votre intention, elle n'assure rien.
User-agent: Perplexity-User
Allow: /

# ---------- Mistral AI ----------
# Indexation pour la recherche, sans entraînement : autorisé.
User-agent: MistralAI-Index
Allow: /

# Actions d'un utilisateur dans l'application. La page de Mistral lue ne dit pas
# si ce robot applique robots.txt.
User-agent: MistralAI-User
Allow: /

# Collecte pour constituer des jeux d'entraînement : refusé.
User-agent: MistralAI-Training
Disallow: /

# ---------- Google ----------
# Ne touchez pas à Googlebot ici : c'est le jeton de la recherche Google.
# Google-Extended couvre l'entraînement des futurs modèles Gemini ET l'ancrage
# dans Gemini Apps et Vertex AI. Il n'a pas d'effet sur Google Search.
# Décommentez les deux lignes seulement si vous refusez ces deux usages.
# User-agent: Google-Extended
# Disallow: /

# ---------- Meta ----------
# Qualité de la recherche de Meta AI : autorisé.
User-agent: Meta-WebIndexer
Allow: /

# Entraînement de modèles ou amélioration de produits : refusé.
User-agent: Meta-ExternalAgent
Disallow: /

# ---------- Autres ----------
# Dépôt ouvert de données du web, utilisé pour la recherche et l'entraînement de modèles : refusé.
User-agent: CCBot
Disallow: /

# Jeton de refus de l'usage pour l'entraînement (n'explore pas) : refusé.
User-agent: Applebot-Extended
Disallow: /

Trois précisions sur ce fichier. La ligne Google-Extended est commentée à dessein : d’après Google, ce jeton couvre l’entraînement des futurs modèles Gemini et l’ancrage dans Gemini Apps et Vertex AI, et le refuser ne retire pas votre site de Google Search.[9] Si vous voulez rester utilisable par Gemini, ne la décommentez pas. Ensuite, d’après la norme, entre deux règles, celle qui cible le chemin de façon plus précise l’emporte.[3] Enfin, si vous utilisez la directive Crawl-delay, sachez qu’elle n’est pas standard : Anthropic l’accepte, et nous n’avons pas lu de source qui l’établisse pour les autres robots.[6]

Google et Bing : l’affichage dans les réponses IA ne passe pas par ces lignes#

Pour Google, ce n’est pas robots.txt qui règle l’affichage dans AI Overviews ou AI Mode : Google renvoie aux contrôles d’extraits (nosnippet, data-nosnippet, max-snippet, noindex), et précise que Google-Extended concerne d’autres systèmes.[13]

Pour Microsoft, un billet de septembre 2023 décrit deux balises meta pour Bing Chat, NOCACHE et NOARCHIVE, sans effet sur les résultats classiques de Bing.[14] Le produit s’appelle désormais Copilot : lisez ce billet comme une piste à reconfirmer, pas comme l’état actuel.[14]

Ce qu’un fichier robots.txt n’assure pas#

La norme est claire : robots.txt n’est pas une forme d’autorisation d’accès, les chemins que vous y listez deviennent publics, et il faut une authentification pour protéger un contenu.[3] Quatre limites en découlent.

  • Les robots d’action peuvent l’ignorer : OpenAI indique que les règles robots.txt peuvent ne pas s’appliquer à ChatGPT-User, Perplexity indique que Perplexity-User l’ignore en général, et Meta que Meta-ExternalFetcher peut l’ignorer.[1][4][10]
  • Un blocage n’est pas toujours étanche : une étude sur la presse a relevé que certains outils avaient récupéré du contenu d’éditeurs qui l’avaient bloqué par robots.txt.[15] Elle porte sur des éditeurs de presse, pas sur des marques.
  • Bloquer les adresses IP d’un robot est déconseillé par Anthropic : le robot ne pourrait plus lire robots.txt, et le blocage peut ne pas fonctionner.[6]
  • Une erreur de serveur peut tout bloquer : un code 4xx sur robots.txt vaut accès libre, un code 5xx vaut blocage complet jusqu’à résolution.[3]

Notre lecture : robots.txt exprime votre intention, et c’est un réglage parmi d’autres. Un pare-feu ou un service de protection applique ses propres règles, que ce fichier ne reflète pas : c’est pourquoi la lecture de vos journaux de serveur compte autant que le fichier lui-même.

Vérifier après la modification#

Trois gestes suffisent, et aucun ne demande d’outil particulier.

  1. Ouvrez l’adresse de votre fichier (votre domaine suivi de /robots.txt) dans un navigateur, et relisez-le robot par robot.
  2. Attendez : OpenAI, Perplexity et Meta indiquent qu’un changement peut demander jusqu’à environ 24 heures.[5][7][10]
  3. Relisez ensuite les journaux de votre serveur, robot par robot, pour voir qui est passé. Les noms de robots du tableau ci-dessus sont ceux à chercher ; pour Anthropic, seules les adresses IP publiées permettent de confirmer l’origine d’une requête.[6]

Pour CCBot, l’authenticité d’une requête se vérifie par DNS inverse ou par la liste d’adresses publiée par Common Crawl.[11] Pensez enfin à relire cette page : les éditeurs ajoutent des robots, et chaque article du journal porte une échéance de revue.

Ce que nous ne savons pas#

Questions fréquentes#

Faut-il bloquer GPTBot pour ne plus être cité par ChatGPT ?

Pas pour cela : d’après la documentation d’OpenAI, GPTBot concerne l’exploration pouvant servir à l’entraînement, tandis que la recherche de ChatGPT relève de OAI-SearchBot, un robot distinct. Ce sont deux robots distincts, que robots.txt permet de régler séparément. Nous n’avons pas mesuré l’effet d’un refus de GPTBot sur les citations.

Un fichier robots.txt empêche-t-il une IA de lire mon site ?

Non, pas de façon sûre : robots.txt est une demande adressée aux robots, pas un contrôle d’accès, et la norme le dit. Certains robots d’action, comme ChatGPT-User ou Perplexity-User, peuvent l’ignorer par conception. Pour protéger un contenu, il faut une authentification.

Que mettre dans robots.txt pour Grok et DeepSeek ?

Rien de documenté : nous n’avons trouvé aucun robot ni aucune page de contrôle publiés par xAI ou DeepSeek, et nous n’écrivons pas de ligne que leurs éditeurs n’ont pas annoncée. Surveillez les journaux de votre serveur et revenez à la documentation de ces éditeurs.

Combien de temps faut-il pour qu’une modification soit prise en compte ?

Jusqu’à environ 24 heures, d’après les pages d’OpenAI, de Perplexity et de Meta. Nous n’avons pas relevé de délai pour les autres éditeurs. Attendez donc une journée avant de conclure qu’une ligne n’a pas d’effet.

Google-Extended retire-t-il mon site des Aperçus IA de Google ?

Non : Google indique que Google-Extended n’a pas d’effet sur la présence dans Google Search, où se trouvent les Aperçus IA. Pour limiter l’affichage dans ces réponses, Google renvoie aux contrôles d’extraits, comme nosnippet ou max-snippet.

Sources#

  1. Overview of OpenAI Crawlers · OpenAI. Documentation officielle. Consulté le . À l’appui de : « OpenAI distingue OAI-SearchBot (recherche de ChatGPT), GPTBot (exploration pouvant servir à l’entraînement) et ChatGPT-User (action demandée par un utilisateur, pour laquelle les règles robots.txt peuvent ne pas s’appliquer) ; ChatGPT-User ne sert pas à décider si un contenu apparaît dans la recherche. »
  2. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic (aide Claude). Documentation officielle. Consulté le . À l’appui de : « Anthropic décrit trois robots : ClaudeBot (collecte pouvant contribuer à l’entraînement), Claude-User (récupération d’un site quand une personne pose à Claude une question qui le nécessite) et Claude-SearchBot (indexation pour améliorer la qualité des résultats de recherche) ; ils respectent les directives robots.txt. »
  3. RFC 9309: Robots Exclusion Protocol · IETF. Documentation officielle. Consulté le . À l’appui de : « La norme du protocole d’exclusion des robots (RFC 9309) précise que robots.txt n’est pas une forme d’autorisation d’accès (les chemins listés deviennent publics, il faut une authentification pour protéger), que la règle la plus spécifique l’emporte, qu’un code 4xx vaut accès libre et un code 5xx blocage complet jusqu’à résolution, et que les analyseurs doivent traiter au moins 500 kibioctets. »
  4. Perplexity Crawlers · Perplexity. Documentation officielle. Consulté le . À l’appui de : « Perplexity décrit PerplexityBot (faire apparaître et lier des sites dans ses résultats, sans entraînement de modèles) et Perplexity-User (action demandée par un utilisateur, qui ignore en général robots.txt parce que la demande vient de la personne). »
  5. Overview of OpenAI Crawlers · OpenAI. Documentation officielle. Consulté le . À l’appui de : « Si OAI-SearchBot et GPTBot sont tous deux autorisés, OpenAI indique qu’un seul passage peut servir aux deux usages ; une modification de robots.txt peut demander environ 24 heures ; OpenAI décrit aussi OAI-AdsBot (vérification de pages d’annonces, sans entraînement). »
  6. Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic (aide Claude). Documentation officielle. Consulté le . À l’appui de : « Anthropic accepte la directive non standard Crawl-delay, déconseille de bloquer ses adresses IP (le robot ne pourrait plus lire robots.txt et le blocage peut ne pas fonctionner) et publie une liste d’adresses IP, mais pas la chaîne user-agent complète de ses robots. »
  7. Perplexity Crawlers · Perplexity. Documentation officielle. Consulté le . À l’appui de : « Perplexity recommande d’autoriser PerplexityBot (et ses plages d’adresses IP publiées) ; un changement de robots.txt peut demander jusqu’à 24 heures ; les chaînes user-agent complètes et les fichiers d’adresses sont publiés. »
  8. Mistral crawlers · Mistral AI. Documentation officielle. Consulté le . À l’appui de : « Mistral publie trois robots : MistralAI-User (actions d’un utilisateur dans l’application, sans exploration automatique), MistralAI-Index (indexation pour la recherche de Mistral, sans entraînement) et MistralAI-Training (collecte pour constituer des jeux d’entraînement) ; l’interdiction de ce dernier se fait par robots.txt ; la chaîne user-agent complète est publiée. »
  9. List of Google's common crawlers · Google Search Central. Documentation officielle. Consulté le . À l’appui de : « Google-Extended est un jeton de contrôle, sans chaîne HTTP distincte, qui permet de décider si le contenu exploré peut servir à entraîner les futurs modèles Gemini et à l’ancrage dans Gemini Apps et Vertex AI ; il n’a pas d’effet sur la présence dans Google Search, dont Googlebot est le jeton. »
  10. Meta Web Crawlers · Meta. Documentation officielle. Consulté le . À l’appui de : « Meta décrit facebookexternalhit (contenus partagés sur ses plateformes, peut ignorer robots.txt pour des contrôles de sécurité ou d’intégrité), Meta-WebIndexer (qualité de la recherche de Meta AI), Meta-ExternalAds, Meta-ExternalAgent (entraînement de modèles ou amélioration de produits) et Meta-ExternalFetcher (liens récupérés à la demande d’un utilisateur, peut ignorer robots.txt) ; un changement peut demander jusqu’à 24 heures. »
  11. CCBot · Common Crawl. Documentation officielle. Consulté le . À l’appui de : « CCBot est le robot de la fondation Common Crawl, qui tient un dépôt ouvert de données du web utilisé pour la recherche et l’entraînement de modèles ; il respecte robots.txt ; son authenticité se vérifie par DNS inverse ou par la liste d’adresses publiée. »
  12. About Applebot · Apple. Documentation officielle. Consulté le . À l’appui de : « Applebot explore le web pour Spotlight, Siri et Safari et ses données peuvent aussi servir à entraîner les modèles de fondation d’Apple ; Applebot-Extended n’explore pas : c’est un jeton de refus de l’usage pour l’entraînement ; Applebot respecte robots.txt. »
  13. AI features and your website · Google Search Central. Documentation officielle. Consulté le . À l’appui de : « Pour limiter l’affichage dans AI Overviews ou AI Mode, Google renvoie aux contrôles d’extraits (nosnippet, data-nosnippet, max-snippet, noindex) ; Google-Extended concerne d’autres systèmes de Google. »
  14. Announcing new options for webmasters to control usage of their content in Bing Chat · Microsoft Bing Webmaster Blog. Documentation officielle. Consulté le . À l’appui de : « En septembre 2023, Microsoft a annoncé pour Bing Chat que la balise meta NOCACHE limite l’affichage d’un contenu à l’adresse, au titre et à l’extrait, et que NOARCHIVE exclut le contenu des réponses et de l’entraînement, sans effet sur les résultats classiques de Bing ; le produit s’appelle désormais Copilot et l’état actuel est à reconfirmer. »
  15. AI Search Has a Citation Problem · Columbia Journalism Review (Tow Center for Digital Journalism). Étude. Consulté le . À l’appui de : « Une étude du Tow Center (Columbia Journalism Review, 6 mars 2025) sur huit outils de recherche générative interrogés sur des articles de presse a relevé que certains outils avaient récupéré du contenu d’éditeurs qui l’avaient bloqué par robots.txt ; l’étude porte sur la presse, pas sur des marques. »

Auteur et journal des modifications#

Auteur
L’équipe GeoMetrick
Relecteur
Esteban, associé de GeoMetrick
Publié le
Dernière mise à jour
Prochaine revue au plus tard

Journal des modifications

  1. : Rédaction à partir des sources citées sur cette page.
  2. : Publication décidée par Esteban (GeoMetrick) après la vérification de chaque affirmation par rapport à sa source (rapport du 02/10/2026) ; les mesures annoncées restent à produire et seront ajoutées à mesure.

À lire ensuite#