Playbook · Passage des robots dans vos journaux
Surveiller le crawl des robots d’IA
Les robots des IA se repèrent dans les journaux de votre serveur, à leur User-Agent. Cette page regroupe quatre anciennes fiches (« Peu de visites GPTBot », « Peu de visites ClaudeBot », « Peu de visites PerplexityBot », « Peu de visites Google-Extended ») et explique ce que ces passages disent, ou ne disent pas, de votre visibilité.
Sommaire de la page
Quel robot fait quoi#
Chaque éditeur exploite plusieurs robots, pour des usages distincts : la recherche (ils alimentent les réponses), la lecture à la demande d’un utilisateur, et l’entraînement des modèles. Leurs réglages sont indépendants : OpenAI précise qu’on peut autoriser un robot et en refuser un autre.[1]
| Éditeur | Robot | Usage documenté | Repérage |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Faire apparaître les sites dans les résultats de recherche de ChatGPT.[1] | User-Agent OAI-SearchBot/1.4 ; adresses IP publiées par OpenAI. |
GPTBot | Entraînement : le contenu peut servir à l’entraînement des modèles.[1] | User-Agent GPTBot/1.4 ; adresses IP publiées. | |
ChatGPT-User | Actions déclenchées par un utilisateur de ChatGPT ; les règles de robots.txt peuvent ne pas s’appliquer.[1] | User-Agent ChatGPT-User/1.0 ; adresses IP publiées. | |
| Anthropic | Claude-SearchBot | Explorer le web pour améliorer la qualité des résultats de recherche ; le bloquer peut réduire la visibilité dans les réponses de Claude.[2] | Adresses IP publiées par Anthropic ; le robots.txt accepte l’extension Crawl-delay.[2] |
ClaudeBot | Entraînement : le bloquer indique que les contenus futurs doivent être exclus des jeux d’entraînement.[2] | ||
Claude-User | Récupérer une page quand un utilisateur pose une question à Claude.[2] | ||
| Perplexity | PerplexityBot | Faire apparaître et lier les sites dans les résultats de Perplexity ; il n’est pas utilisé pour entraîner des modèles de fondation. Perplexity recommande de l’autoriser.[3] | User-Agent PerplexityBot/1.0 ; adresses IP publiées. |
Perplexity-User | Visite d’une page à la demande d’un utilisateur ; il ignore généralement les règles de robots.txt.[3] | User-Agent Perplexity-User/1.0 ; adresses IP publiées. | |
Googlebot | Construire l’index de Google Search ; les aperçus IA s’appuient sur cet index.[4] [5] | User-Agent Googlebot (ordinateur et mobile). | |
Google-Extended | Contrôler l’usage de votre contenu pour l’entraînement et l’ancrage de Gemini ; il n’a aucun effet sur Google Search ni comme signal de classement.[4] | Aucun User-Agent propre : jeton valable seulement dans robots.txt.[4] |
Noms et chaînes des robots tels que publiés par chaque éditeur, lus le 30/09/2026. Les numéros de version peuvent changer : cherchez le nom du robot, pas la version.
Les repérer dans vos journaux#
Les journaux d’accès de votre hébergeur notent le User-Agent de chaque requête. Pour y chercher les robots d’IA, filtrez sur leurs noms. Les commandes ci-dessous supposent un journal au format combiné (celui de nginx et d’Apache par défaut) nommé access.log ; adaptez le chemin à votre hébergement.
Lister les passages
grep -E "OAI-SearchBot|GPTBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot|Perplexity-User" access.logCompter les passages par robot
for b in OAI-SearchBot GPTBot ChatGPT-User ClaudeBot Claude-SearchBot Claude-User PerplexityBot Perplexity-User; do
echo "$b $(grep -c "$b" access.log)"
doneLire les codes de réponse
Un robot qui reçoit surtout des erreurs (403, 429, 5xx) ne lit rien, même s’il passe souvent. Cette commande compte les codes renvoyés aux robots de recherche et d’entraînement les plus courants.
grep -E "OAI-SearchBot|ClaudeBot|Claude-SearchBot|PerplexityBot" access.log | awk '{print $9}' | sort | uniq -cQuand un robot passe peu ou pas#
Un faible nombre de passages n’a pas la même signification selon le robot. Voici comment lire chacun des quatre cas des anciennes fiches.
Peu de visites de GPTBot
GPTBot sert à l’entraînement des modèles d’OpenAI.[1] Son absence n’empêche pas, en soi, d’être cité dans la recherche de ChatGPT : c’est OAI-SearchBot qu’il faut regarder, et ne pas bloquer. Autoriser ou non GPTBot est une décision de politique d’entraînement.
Peu de visites de ClaudeBot
ClaudeBot sert à l’entraînement ; Claude-SearchBot améliore les résultats de recherche et Claude-User agit à la demande d’un utilisateur.[2] Pour la visibilité dans les réponses de Claude, surveillez Claude-SearchBot et Claude-User, et ne les bloquez pas.
Peu de visites de PerplexityBot
PerplexityBot fait apparaître et lier les sites dans les résultats de Perplexity ; Perplexity recommande de l’autoriser dans robots.txt.[3] Un faible passage invite à vérifier le robots.txt, le pare-feu et les codes de réponse avant toute autre hypothèse.
Peu de visites de Google-Extended
Google-Extended ne peut pas « visiter » votre site : il n’a pas de User-Agent propre.[4] Ne concluez rien de son absence. Pour votre présence dans les réponses de Google, vérifiez que vos pages sont indexées et éligibles à un extrait ; c’est Googlebot qu’il faut observer, dans la Search Console.[5]
Que vérifier, dans l’ordre
- Le robots.txt. Aucune règle
Disallow: /ne doit viser les robots de recherche. OpenAI indique qu’une modification peut prendre environ 24 heures à être prise en compte par son robot de recherche.[1] - Le pare-feu et le CDN. Google rappelle que l’exploration doit être autorisée par robots.txt, mais aussi par votre CDN et votre hébergement ; un robot peut être bloqué sans que robots.txt le montre.[5]
- Les codes de réponse. Corrigez les erreurs 4xx et 5xx renvoyées aux robots (voir la commande plus haut).
- Le contenu dans le HTML. Les robots d’OpenAI, d’Anthropic et de Perplexity n’exécutent pas le JavaScript d’après l’analyse de Vercel et MERJ de décembre 2024 : un texte absent du HTML reçu ne leur est pas visible.[6]
- La patience. Nous n’avons trouvé aucune fréquence de passage garantie ni procédure pour « soumettre » un site : OpenAI demande simplement de ne pas bloquer OAI-SearchBot.[7]
Exemple de robots.txt
Autoriser les robots de recherche des trois éditeurs et refuser l’entraînement de deux modèles (à adapter à votre politique) :
# Recherche : autorisée (c’est elle qui alimente les réponses)
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Entraînement : à vous de décider
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /Fiches liées
- Débloquer les bots IA dans robots.txtVérifier et corriger les règles qui retirent votre site des réponses de recherche.
- Revoir les règles bots IA dans robots.txtAutoriser la recherche et refuser l’entraînement, robot par robot.
- GPTBot n’a pas encore visité votre siteLire l’absence de GPTBot dans vos journaux.
- Ratio de crawls IA / total trop basAnalyser vos journaux avant de conclure.
Questions fréquentes#
GPTBot ne visite pas mon site : est-ce grave ?
Pas nécessairement : GPTBot sert à l’entraînement des modèles d’OpenAI, alors que la recherche de ChatGPT passe par OAI-SearchBot. Vérifiez surtout que OAI-SearchBot n’est pas bloqué par votre robots.txt ou votre pare-feu.
Comment savoir si Google-Extended visite mon site ?
Vous ne pouvez pas le savoir dans vos journaux : Google-Extended n’a pas de User-Agent propre, c’est un jeton qui ne sert que dans robots.txt. Il n’a aucun effet sur votre présence dans Google Search.
Peut-on demander à un robot d’IA de venir plus souvent ?
Nous n’avons trouvé aucune procédure documentée pour cela chez OpenAI, Anthropic ou Perplexity. Leurs documentations demandent surtout de ne pas bloquer leurs robots de recherche.
Faut-il autoriser tous ces robots ?
Cela dépend de leur usage : les robots de recherche alimentent les réponses, ceux d’entraînement non. Bloquer un robot de recherche vous retire des réponses correspondantes ; refuser l’entraînement est un choix légitime, qui se règle robot par robot.
Sources#
Documentation officielle des éditeurs, consultée le 30/09/2026. Les pages sans date visible sont signalées comme telles.
- OpenAI, « Overview of OpenAI Crawlers » (OAI-SearchBot, GPTBot, ChatGPT-User) · page sans date visible, consultée le 30/09/2026.
- Anthropic, centre d’aide, « Does Anthropic crawl data from the web, and how can site owners block the crawler? » (ClaudeBot, Claude-User, Claude-SearchBot) · 07/04/2026. Consulté le 30/09/2026.
- Perplexity, documentation, « Perplexity crawlers » (PerplexityBot, Perplexity-User) · page sans date visible, consultée le 30/09/2026.
- Google Search Central, documentation des robots d’exploration de Google (Googlebot, Google-Extended) · mis à jour le 14/07/2026. Consulté le 30/09/2026.
- Google Search Central, « AI features and your website » · page indiquant une mise à jour le 10/12/2025. Consulté le 30/09/2026.
- Vercel et MERJ, « The rise of the AI crawler » · 17/12/2024. Consulté le 30/09/2026. Mesure faite sur le réseau de Vercel fin 2024 ; les comportements des robots peuvent avoir changé depuis.
- OpenAI, centre d’aide, « Publishers and Developers – FAQ » · page consultée le 30/09/2026.