Journal · Comprendre le GEO

Comment une IA choisit les pages qu’elle cite

Une IA décide de chercher, lance une ou plusieurs requêtes, lit des pages puis les cite. Ce que les éditeurs documentent, et ce qu’aucun ne publie.

Par L’équipe GeoMetrickRelu par Esteban, associé de GeoMetrickPublié le Lecture : environ 6 min

Sommaire de la page
  1. Aucun éditeur ne publie ses critères de choix
  2. Le mécanisme documenté, en trois étapes
  3. Ce que chaque éditeur documente, et ce qu’il ne dit pas
  4. Ce que l’on peut voir côté site : un exemple chez Bing
  5. Les robots qui lisent les pages : trois rôles chez OpenAI
  6. Les sources tierces pèsent-elles davantage ?
  7. Ce que nous mesurerons : les schémas de citation (à produire)
  8. Ce que nous avons mesuré
  9. Ce que nous ne savons pas
  10. Questions fréquentes
  11. Sources
  12. Auteur et journal des modifications
  13. À lire ensuite

Aucun éditeur ne publie ses critères de choix#

Aucun éditeur d’IA dont nous avons lu la documentation (Google, OpenAI, Anthropic, Perplexity, Microsoft) ne publie les critères qui font retenir une page plutôt qu’une autre : ce qu’elle décrit, c’est le mécanisme de recherche. Pour Google, la page officielle indique elle-même qu’elle ne dit pas comment Google choisit parmi les pages candidates.[1]

Toute phrase du type « l’IA choisit les pages qui… » est donc une observation ou une hypothèse. Dans cet article, nous séparons ce qui est documenté, ce qui a été observé par des tiers, et ce que nous mesurerons nous-mêmes.

Le mécanisme documenté, en trois étapes#

Les documentations que nous avons lues décrivent la même suite d’actions, avec des variantes selon l’éditeur.

  1. Décider de chercher. Avec l’API Gemini, le modèle analyse la demande et décide si une recherche Google peut améliorer la réponse.[2] Avec l’API de Claude, la recherche est utilisée quand la demande dépend d’informations récentes, changeantes ou hors de l’entraînement.[3] Copilot repère les termes pour lesquels le web améliorerait la réponse.[4]
  2. Lancer une ou plusieurs requêtes. Google décrit un regroupement de requêtes (« query fan-out ») : plusieurs recherches liées sur des sous-thèmes, pour afficher un ensemble de liens plus large qu’une recherche classique.[1] Claude peut répéter la recherche dans une même requête, avec en général une à trois recherches pour une demande simple et dix ou plus pour une comparaison.[3] L’API de Perplexity accepte jusqu’à cinq requêtes liées dans un appel.[5] Copilot génère une courte requête, différente de la demande d’origine.[4]
  3. Lire et citer. L’API d’OpenAI permet de rechercher, d’ouvrir une page et de chercher dans une page, et renvoie des citations en ligne ainsi qu’un champ listant toutes les adresses consultées, souvent plus nombreuses que celles citées.[6] L’API Gemini rattache les citations à des segments précis du texte.[2] Claude cite ses sources avec adresse, titre et un court extrait.[3]

Notre lecture : pour Google et pour Copilot en usage professionnel, la question que vous posez n’est pas forcément la requête qui est lancée. Une page peut donc être lue pour une sous-question que personne n’a tapée telle quelle, mais les sources lues ne l’établissent pas pour les autres IA.

Ce que chaque éditeur documente, et ce qu’il ne dit pas#

IA Ce que la documentation décrit Ce qu’elle ne dit pas
Google (Aperçus IA et Mode IA) Regroupement de requêtes ; aucune exigence supplémentaire pour apparaître ; trafic compté dans la Search Console.[1] Comment Google choisit parmi les pages candidates, le poids des signaux.
Gemini (API) Le modèle décide de chercher, lance une ou plusieurs requêtes, cite des segments précis.[2] Comment les pages sont choisies parmi les résultats ; l’application grand public.
Claude (API) Décision de chercher, recherches répétées, citations avec adresse, titre et extrait.[3] Le moteur ou l’index sous-jacent, le classement ; l’application.
ChatGPT (API d’OpenAI) Trois modes de recherche, trois actions, adresses consultées listées.[6] Le classement ; l’application ChatGPT.
Perplexity (API) Jusqu’à cinq requêtes liées par appel, résultats classés avec extraits réglables.[5] Si Perplexity exploite un index propre, comment le classement est calculé ; l’application.
Copilot (Microsoft 365, usage en entreprise) Une courte requête envoyée à Bing, différente de la demande ; requêtes exactes visibles dans Copilot Chat.[4] Les critères de sélection des pages ; l’application grand public.

Pour Mistral, Grok et DeepSeek, cet article ne cite aucune source sur la manière dont ils choisissent et citent des pages.

Ce que l’on peut voir côté site : un exemple chez Bing#

Bing propose depuis février 2026, en aperçu public, un tableau de bord qui montre quand un site est cité dans Microsoft Copilot et dans les résumés générés par Bing : total de citations, pages distinctes citées par jour, échantillon des requêtes d’ancrage et fréquence par adresse.[7] Il ne donne ni clics ni positions, les données sont un échantillon, et le périmètre est limité aux produits Microsoft.[7]

C’est une fenêtre utile sur le regroupement de requêtes, mais seulement pour ces produits.

Les robots qui lisent les pages : trois rôles chez OpenAI#

OpenAI distingue trois robots : OAI-SearchBot, qui sert à faire apparaître les sites dans la recherche de ChatGPT ; GPTBot, dont l’exploration peut servir à l’entraînement ; et ChatGPT-User, qui agit sur demande d’un utilisateur.[8] Ce dernier ne sert pas à décider si un contenu apparaît dans la recherche, et les règles du fichier robots.txt peuvent ne pas s’y appliquer.[8]

Ces rôles disent quel robot lit pour quel usage. Ils ne disent pas quelle page est retenue : la même page d’OpenAI précise seulement que, si les deux premiers robots sont autorisés, un seul passage peut servir aux deux usages.[8]

Les sources tierces pèsent-elles davantage ?#

Une étude de septembre 2025 compare ChatGPT, Perplexity et Gemini à Google : les moteurs d’IA y privilégient fortement les sources tierces faisant autorité plutôt que les contenus de marque.[9] C’est le résultat d’une étude, pas une loi générale ; Claude, Mistral, Grok et DeepSeek n’y sont pas nommés.[9]

De son côté, Google écrit qu’il n’est pas nécessaire de créer des fichiers texte pour IA, un balisage spécial ou du Markdown, et que le découpage en « petits morceaux » est à ignorer, pour ses propres fonctions.[10]

Ce que nous mesurerons : les schémas de citation (à produire)#

Cette partie décrit un protocole. Aucun résultat n’est publié ici.

Pour chaque réponse d’une IA à une question de marque, nous relèverons :

  • les requêtes lancées, quand l’IA les expose ;
  • les adresses citées, et les adresses consultées quand l’éditeur les liste ;
  • le type de chaque source : site de la marque, source tierce, annuaire, presse ;
  • l’IA, son mode (avec ou sans recherche web), la langue et la date.

Chaque question est posée plusieurs fois à chaque IA, et les résultats sont regroupés par question, selon les règles de la page Méthodologie. Ce que nous publierons : des fréquences de citation par type de source, avec le nombre de réponses et une fourchette de confiance, sans classement de pages.

Affirmation Statut aujourd’hui
Une IA décide de chercher, lance une ou plusieurs requêtes, puis cite des sources Documenté par les éditeurs, pour des API et certains produits.[2]
La requête lancée diffère de la question posée Documenté pour Google (regroupement de requêtes)[1] et pour Copilot en usage professionnel.[4]
Telle page est retenue parce que… Non documenté : observation à produire, ou hypothèse.
Les sources tierces pèsent davantage que les contenus de marque Résultat d’une étude sur trois moteurs.[9]

Ce que cette mesure ne dira pas : pourquoi une page précise est retenue, ni ce que voit une personne donnée dans son application.

Ce que nous avons mesuré#

Ce que nous ne savons pas#

Questions fréquentes#

Comment une IA décide-t-elle quelles pages citer ?

Aucun éditeur d’IA dont nous avons lu la documentation ne publie ses critères de choix. Ce qui est documenté, c’est le mécanisme : l’IA décide de chercher, lance une ou plusieurs requêtes, lit des pages, puis cite des sources.

La requête lancée par l’IA est-elle la question que j’ai posée ?

Pas forcément. Google décrit un regroupement de requêtes sur des sous-thèmes pour ses Aperçus IA, et Microsoft décrit, pour Copilot en usage professionnel, une courte requête différente de la demande d’origine.

Les robots d’OpenAI jouent-ils tous le même rôle ?

Non. OpenAI documente trois rôles distincts : OAI-SearchBot pour la recherche de ChatGPT, GPTBot pour une exploration pouvant servir à l’entraînement, ChatGPT-User pour les actions demandées par un utilisateur. Vérifiez la documentation d’OpenAI avant de modifier votre robots.txt.

Puis-je voir les requêtes pour lesquelles mon site est cité ?

Partiellement, et seulement chez Microsoft : Bing propose en aperçu public un tableau de bord qui montre un échantillon des requêtes d’ancrage et le nombre de citations, sans clics ni positions. Pour les autres IA, nous n’avons pas de source à citer.

Sources#

  1. AI features and your website · Google Search Central. Documentation officielle. Consulté le . À l’appui de : « Les Aperçus IA et le Mode IA de Google peuvent recourir à un « query fan-out » : plusieurs recherches liées sur des sous-thèmes et des sources de données, pour composer une réponse et afficher un ensemble de liens plus large qu’une recherche classique. Aucune exigence supplémentaire n’est nécessaire pour y apparaître (page indexée et éligible à l’extrait) et le trafic est compté dans le rapport Performance de la Search Console. La page ne dit pas comment Google choisit parmi les pages candidates, ni le poids des signaux. »
  2. Grounding with Google Search · Google (Gemini API). Documentation officielle. Consulté le . À l’appui de : « Dans l’API Gemini avec ancrage sur Google Search, le modèle analyse la demande et décide si une recherche Google peut améliorer la réponse ; il peut lancer une ou plusieurs requêtes ; la réponse contient les requêtes exécutées et des citations rattachées à des segments précis du texte (indices de début et de fin). La page décrit l’API, pas l’application grand public, et ne dit pas comment les pages sont choisies parmi les résultats. »
  3. Web search tool · Anthropic. Documentation officielle. Consulté le . À l’appui de : « Dans l’API de Claude, l’outil de recherche web est utilisé quand la demande dépend d’informations récentes, changeantes ou hors de l’entraînement ; la recherche peut se répéter plusieurs fois dans une même requête, plafonnée par un paramètre ; la réponse cite ses sources avec adresse, titre et un extrait de 150 caractères au plus ; les demandes simples utilisent en général une à trois recherches, les comparaisons dix ou plus. La page ne dit pas quel moteur ou index sous-jacent est utilisé, ni le classement, et décrit l’API, pas l’application. »
  4. Data, privacy, and security for web search in Microsoft Copilot and Microsoft Copilot Chat · Microsoft Learn. Documentation officielle. Consulté le . À l’appui de : « Microsoft Copilot analyse la demande, repère les termes pour lesquels le web améliorerait la réponse et génère une courte requête envoyée au service Bing, différente de la demande d’origine ; Copilot Chat affiche les requêtes exactes envoyées dans une section de citations de requêtes. La page concerne Microsoft 365 Copilot (usage en entreprise), pas forcément l’application grand public, et ne dit pas les critères de sélection des pages. »
  5. Perplexity Search API · Perplexity. Documentation officielle. Consulté le . À l’appui de : « L’API de recherche de Perplexity accepte jusqu’à cinq requêtes liées dans un appel, traitées indépendamment, et renvoie des résultats classés en temps réel avec des extraits dont la taille est réglable, filtrables par domaine, langue et région. La page ne dit pas si Perplexity exploite un index propre ni comment le classement est calculé, et décrit l’API, pas l’application. »
  6. Web search · OpenAI. Documentation officielle. Consulté le . À l’appui de : « Le guide de recherche web de l’API d’OpenAI décrit trois modes (recherche sans raisonnement où la requête de l’utilisateur est transmise à l’outil, recherche dite agentique pilotée par un modèle de raisonnement, recherche approfondie sur de nombreuses sources) et trois actions possibles (rechercher, ouvrir une page, chercher dans une page) ; la réponse comporte des citations en ligne et un champ listant toutes les adresses consultées, souvent plus nombreuses que celles citées. La page ne dit pas le classement et décrit l’API, pas l’application ChatGPT. »
  7. Introducing AI Performance in Bing Webmaster Tools (Public Preview) · Microsoft Bing Webmaster Blog. Documentation officielle. Consulté le . À l’appui de : « Bing propose depuis février 2026, en aperçu public, un tableau de bord « AI Performance » qui montre quand un site est cité dans Microsoft Copilot, dans les résumés générés par Bing et chez des partenaires sélectionnés : total de citations, pages distinctes citées par jour, échantillon des requêtes d’ancrage, fréquence par adresse. Il ne donne ni clics ni positions, les données sont un échantillon et le périmètre est limité aux produits Microsoft. »
  8. Overview of OpenAI Crawlers · OpenAI. Documentation officielle. Consulté le . À l’appui de : « OpenAI distingue OAI-SearchBot (faire apparaître les sites dans la recherche de ChatGPT), GPTBot (exploration de contenu pouvant servir à l’entraînement) et ChatGPT-User (agit sur demande d’un utilisateur, ce n’est pas une exploration automatique et les règles robots.txt peuvent ne pas s’y appliquer ; ne sert pas à décider si un contenu apparaît dans la recherche). Si les deux premiers sont autorisés, un seul passage peut servir aux deux usages. Un changement de robots.txt peut demander environ 24 heures. La page ne dit pas comment sont choisies les pages citées. »
  9. Generative Engine Optimization: How to Dominate AI Search · Chen, Wang, Chen, Koudas (arXiv). Étude. Consulté le . À l’appui de : « Une étude de septembre 2025 compare des moteurs d’IA (ChatGPT, Perplexity, Gemini) à Google : les moteurs d’IA privilégient fortement les sources tierces faisant autorité (« earned media ») plutôt que les contenus de marque, et diffèrent selon la diversité des domaines, la fraîcheur, la stabilité d’une langue à l’autre et la sensibilité à la reformulation. Claude, Mistral, Grok et DeepSeek n’y sont pas nommés. »
  10. Optimizing your website for generative AI features on Google Search · Google Search Central. Documentation officielle. Consulté le . À l’appui de : « Google écrit qu’il n’est pas nécessaire de créer des fichiers lisibles par machine, des fichiers texte pour IA, un balisage spécial ou du Markdown pour apparaître dans ses fonctions d’IA générative, et que le découpage en « petits morceaux » (chunking) et l’achat de mentions artificielles sont à ignorer. Cela vaut pour Google Search seulement. »

Auteur et journal des modifications#

Auteur
L’équipe GeoMetrick
Relecteur
Esteban, associé de GeoMetrick
Publié le
Dernière mise à jour
Prochaine revue au plus tard

Journal des modifications

  1. : Rédaction assistée par un agent à partir des sources citées sur cette page ; schémas de citation à produire.
  2. : Publication décidée par Esteban (GeoMetrick) après la vérification de chaque affirmation par rapport à sa source (rapport du 02/10/2026) ; les mesures annoncées restent à produire et seront ajoutées à mesure.

À lire ensuite#