Journal · Comprendre le GEO
Une même question, neuf IA : protocole d’une mesure honnête
Une même question posée à neuf IA donne-t-elle les mêmes réponses et les mêmes sources ? Le protocole de notre mesure, et ce que nous ne saurons pas.
Sommaire de la page
- Ce que nous savons aujourd’hui : rien de chiffré sur nos neuf IA
- Ce que les études externes ont comparé
- Les neuf IA ne cherchent pas toutes de la même façon
- Ce que nous interrogeons, IA par IA
- Le protocole prévu
- Ce que cette mesure ne pourra pas dire
- Ce que nous avons mesuré
- Ce que nous ne savons pas
- Questions fréquentes
- Sources
- Auteur et journal des modifications
- À lire ensuite
Ce que nous savons aujourd’hui : rien de chiffré sur nos neuf IA#
Nous ne savons pas encore si une même question donne les mêmes réponses et les mêmes sources chez neuf IA : aucune étude publiée que nous avons lue ne compare neuf produits sur des questions de marque, et notre propre mesure n’est pas encore produite.[1]
Cet article décrit donc la question posée, les neuf IA, les répétitions prévues, ce que nous regarderons et ce que nous ne saurons pas. Il sera complété avec les résultats, leur date, leur protocole et leurs limites quand les mesures auront été validées.
Ce que les études externes ont comparé#
Quatre études publiées comparent des moteurs d’IA. Aucune ne porte sur des questions de marque, et nous ne comparons pas leurs chiffres aux nôtres : les périmètres diffèrent.
| Étude | Périmètre | Ce qu’elle rapporte | Ce qu’elle ne dit pas |
|---|---|---|---|
| Tow Center, Columbia Journalism Review (mars 2025) | Huit outils de recherche générative, 1 600 requêtes sur des articles de presse | Plus de 60 % de réponses fausses au total (de 37 % à 94 % selon l’outil) ; peu de doutes exprimés ; liens fabriqués ou cassés.[1] | Rien sur des marques ; les requêtes ne sont pas répétées ; versions des outils à la date de l’étude, pas celles d’aujourd’hui. |
| Union européenne de radiodiffusion (octobre 2025) | 22 médias, 18 pays, 14 langues, plus de 3 000 réponses de quatre assistants | 45 % des réponses avec au moins un problème significatif, 31 % de problèmes de sources, 20 % de problèmes d’exactitude majeurs.[2] | Versions, période exacte et seuil de « problème significatif » non précisés ; rien sur les marques. |
| Chen et coauteurs (septembre 2025) | ChatGPT, Perplexity et Gemini comparés à Google | Les moteurs d’IA privilégient les sources tierces faisant autorité et diffèrent par la fraîcheur, la stabilité d’une langue à l’autre et la sensibilité à la reformulation.[3] | Les limites (non lues dans le résumé) ; Claude, Mistral, Grok et DeepSeek ne sont pas nommés. |
| Zhang et coauteurs (décembre 2025) | 55 936 requêtes, six moteurs à base de modèles de langage et deux moteurs classiques | Les premiers citent des domaines plus variés (37 % leur sont propres), sans faire mieux sur la crédibilité, la neutralité politique et la sécurité.[4] | Les noms des six moteurs (absents du résumé lu). |
Les limites déclarées par la première étude valent aussi pour toute mesure de ce genre : facteurs externes seulement, et réponses prises comme instances uniques alors qu’elles varient.[1]
Les neuf IA ne cherchent pas toutes de la même façon#
Chaque éditeur documente sa recherche à sa manière, et pas toujours pour l’application que le public utilise.
| IA | Ce que la documentation lue décrit | Ce qu’elle ne dit pas |
|---|---|---|
| Aperçus IA de Google | Plusieurs recherches liées sur des sous-thèmes (« query fan-out »).[5] | Comment Google choisit parmi les pages candidates. |
| Gemini (API) | Le modèle décide de chercher, lance une ou plusieurs requêtes, cite des segments précis.[6] | L’application grand public. |
| Claude (API) | Recherche déclenchée selon la demande, parfois répétée, citations avec adresse, titre et extrait.[7] | Le moteur ou l’index sous-jacent ; l’application. |
| ChatGPT (API d’OpenAI) | Trois modes de recherche, adresses consultées listées.[8] | Le classement ; l’application ChatGPT. |
| Perplexity (API) | Jusqu’à cinq requêtes liées par appel, résultats classés.[9] | Comment le classement est calculé ; l’application. |
| Copilot (Microsoft 365) | Une courte requête envoyée à Bing, différente de la demande.[10] | Les critères de sélection ; l’application grand public. |
| Grok (API de xAI) | Le modèle décide d’appeler la recherche web, peut le faire plusieurs fois, cite.[11] | Les critères de choix ; l’application Grok. |
| Mistral | Aucune source ouverte lue ne décrit comment sa recherche choisit et cite des pages. | Les critères de choix et de citation. |
| DeepSeek | Aucune source ouverte lue ne décrit comment sa recherche choisit et cite des pages. | Les critères de choix et de citation. |
Ces lignes décrivent surtout des API ou des produits d’entreprise : elles ne disent pas ce que voit un client dans l’application.
Ce que nous interrogeons, IA par IA#
Voici, pour chaque IA, ce que notre mesure interroge et ce qu’elle ne couvre pas. Cette liste reprend, en substance, celle de la page des IA du site.
| IA | Ce que nous interrogeons | Ce que nous ne mesurons pas |
|---|---|---|
| ChatGPT | L’API d’OpenAI, avec et sans recherche web | L’application : cartes de lieux, pastilles de sources, personnalisation |
| Gemini | Gemini via Vertex AI, avec et sans ancrage sur Google Search | L’application Gemini et ses cartes de lieux |
| Perplexity | L’API de Perplexity, où la recherche web est native | L’interface et l’onglet « Lieux » |
| Claude | Le modèle Claude par l’API, sans recherche web | Ce que Claude cite quand il cherche sur le web |
| Mistral | Les modèles de Mistral par l’API, sans recherche web | Ce que l’application cite avec sa recherche |
| Aperçus IA de Google | L’Aperçu IA affiché par Google pour la question, quand il existe | Le Mode IA ; l’absence d’aperçu est un résultat, pas une erreur |
| Grok | Le modèle Grok par l’API de xAI, avec réserves | L’application Grok et ce que Grok trouve sur X |
| DeepSeek | Le modèle de discussion par l’API, sans recherche web | Ce que l’application cite avec son bouton de recherche |
| Copilot | Ce que Bing, la source de Copilot, affiche pour la question : une approximation | Ce que Copilot répond et quelles pages il cite |
La conséquence est directe : les neuf IA ne sont pas interrogées dans le même mode. Mélanger ce que savent des modèles sans recherche et ce que trouvent des moteurs avec recherche dans un même chiffre serait trompeur. Le mode de chaque réponse est donc relevé, et il est écrit à côté de chaque résultat.
Le protocole prévu#
Ce protocole est une proposition : le nombre définitif de réponses et le coût sont fixés dans une demande de mesure que nous validons avant tout lancement.
- La question. La même question, mot pour mot, est posée à chaque IA, en français, sans historique de conversation, le même jour. Elle est choisie et fixée avant le lancement, et publiée avec les résultats.
- Les répétitions. Chaque IA reçoit la question plusieurs fois, parce qu’une IA ne répond jamais deux fois pareil. L’exemple de la page Méthodologie utilise cinq répétitions par question ; le nombre retenu pour cette mesure sera écrit dans l’article.
- Ce que nous regarderons. Les marques citées et leur recoupement entre IA ; les domaines des sources citées et leur recoupement ; la variation d’une répétition à l’autre pour une même IA ; l’absence de réponse ou d’aperçu ; le mode de chaque réponse.
- Ce que nous publierons. Des fréquences, avec le nombre de réponses et une fourchette de confiance, par IA et par mode. Aucun classement des IA : une seule question ne peut pas en établir.
Ce que cette mesure ne pourra pas dire#
- Elle ne dira pas ce que voit une personne donnée : localisation, historique et compte personnel changent les réponses, et nous interrogeons surtout des API.
- Une seule question n’est pas toutes les formulations possibles : deux personnes qui veulent la même chose n’écrivent pas la même question.
- La fourchette de confiance ne couvre ni un changement de version de modèle, ni la période, ni la formulation. C’est pourquoi chaque mesure est datée et rejouée avec le même protocole.
- Elle ne dira pas pourquoi une IA cite une page plutôt qu’une autre : aucun éditeur ne publie ses critères de choix.
Pour la lecture des fourchettes, voir notre article sur les répétitions et les intervalles de confiance.
Ce que nous avons mesuré#
Ce que nous ne savons pas#
Questions fréquentes#
Les neuf IA donnent-elles les mêmes réponses à une même question ?
Nous ne le savons pas encore pour nos neuf IA : notre mesure n’est pas produite. Aucune étude publiée que nous avons lue ne compare neuf produits sur des questions de marque.
Pourquoi publier un protocole avant les résultats ?
Pour que la méthode puisse être critiquée avant que les chiffres existent : la question, les IA, les répétitions, ce que nous regarderons et ce que nous ne saurons pas sont fixés d’abord. Des résultats sans protocole ne se vérifient pas.
Interrogez-vous les applications grand public ?
Pas toutes. Nous interrogeons en général des interfaces de programmation (API), avec ou sans recherche web selon l’IA, ce qui peut différer de ce que voit un client sur son téléphone. Le mode de chaque IA est indiqué dans l’article.
Pourquoi poser plusieurs fois la même question à chaque IA ?
Parce qu’une IA ne répond pas deux fois de la même façon : une réponse unique ne mesure rien. Notre article sur les répétitions et les fourchettes de confiance détaille la raison et la méthode.
Sources#
- AI Search Has a Citation Problem · Columbia Journalism Review (Tow Center for Digital Journalism). Étude. Consulté le . À l’appui de : « Le Tow Center (Columbia Journalism Review, 6 mars 2025) a testé huit outils de recherche générative sur 1 600 requêtes (20 éditeurs de presse, 10 articles chacun) : retrouver le titre, l’éditeur, la date et l’adresse d’un extrait. Plus de 60 % de réponses fausses au total (de 37 % à 94 % selon l’outil), peu de doutes exprimés, liens fabriqués ou cassés ; certains outils ont récupéré du contenu d’éditeurs qui l’avaient bloqué par robots.txt. Limites déclarées : facteurs externes seulement, réponses prises comme instances uniques alors qu’elles varient, pas d’extrapolation. L’étude ne porte pas sur des marques et ne répète pas les requêtes. »
- Largest study of its kind shows AI assistants misrepresent news content 45% of the time · European Broadcasting Union (avec la BBC). Étude. Consulté le . À l’appui de : « L’Union européenne de radiodiffusion (avec la BBC), le 22 octobre 2025 : 22 médias de service public de 18 pays, 14 langues, plus de 3 000 réponses de quatre assistants relues par des journalistes ; 45 % présentent au moins un problème significatif, 31 % des problèmes de sources, 20 % des problèmes d’exactitude majeurs. Le communiqué ne précise ni les versions des assistants, ni la période exacte, ni le seuil de « problème significatif », et ne dit rien des marques. »
- Generative Engine Optimization: How to Dominate AI Search · Chen, Wang, Chen, Koudas (arXiv). Étude. Consulté le . À l’appui de : « Une étude de septembre 2025 compare des moteurs d’IA (ChatGPT, Perplexity, Gemini) à Google : les moteurs d’IA privilégient fortement les sources tierces faisant autorité (« earned media ») plutôt que les contenus de marque, et diffèrent selon la diversité des domaines, la fraîcheur, la stabilité d’une langue à l’autre et la sensibilité à la reformulation. Claude, Mistral, Grok et DeepSeek n’y sont pas nommés. »
- Source Coverage and Citation Bias in LLM-based vs. Traditional Search Engines · Zhang, Ye, Peng, Garimella, Tyson (arXiv). Étude. Consulté le . À l’appui de : « Une étude de décembre 2025 portant sur 55 936 requêtes compare six moteurs de recherche à base de modèles de langage et deux moteurs classiques : les premiers citent des domaines plus variés (37 % des domaines leur sont propres) mais ne font pas mieux sur la crédibilité, la neutralité politique et la sécurité. Les noms des six moteurs ne figurent pas dans le résumé lu. »
- AI features and your website · Google Search Central. Documentation officielle. Consulté le . À l’appui de : « Les Aperçus IA et le Mode IA de Google peuvent recourir à un « query fan-out » : plusieurs recherches liées sur des sous-thèmes et des sources de données, pour composer une réponse et afficher un ensemble de liens plus large qu’une recherche classique. La page ne dit pas comment Google choisit parmi les pages candidates. »
- Grounding with Google Search · Google (Gemini API). Documentation officielle. Consulté le . À l’appui de : « Dans l’API Gemini avec ancrage sur Google Search, le modèle analyse la demande et décide si une recherche Google peut améliorer la réponse ; il peut lancer une ou plusieurs requêtes ; la réponse contient les requêtes exécutées et des citations rattachées à des segments précis du texte. La page décrit l’API, pas l’application grand public. »
- Web search tool · Anthropic. Documentation officielle. Consulté le . À l’appui de : « Dans l’API de Claude, l’outil de recherche web est utilisé quand la demande dépend d’informations récentes, changeantes ou hors de l’entraînement ; la recherche peut se répéter plusieurs fois dans une même requête ; la réponse cite ses sources avec adresse, titre et un court extrait. La page décrit l’API, pas l’application, et ne dit pas quel moteur ou index sous-jacent est utilisé. »
- Web search · OpenAI. Documentation officielle. Consulté le . À l’appui de : « Le guide de recherche web de l’API d’OpenAI décrit trois modes (recherche sans raisonnement, recherche dite agentique pilotée par un modèle de raisonnement, recherche approfondie sur de nombreuses sources), des citations en ligne et un champ listant toutes les adresses consultées, souvent plus nombreuses que celles citées. La page décrit l’API, pas l’application ChatGPT, et ne dit pas le classement. »
- Perplexity Search API · Perplexity. Documentation officielle. Consulté le . À l’appui de : « L’API de recherche de Perplexity accepte jusqu’à cinq requêtes liées dans un appel, traitées indépendamment, et renvoie des résultats classés en temps réel, filtrables par domaine, langue et région. La page décrit l’API, pas l’application, et ne dit pas comment le classement est calculé. »
- Data, privacy, and security for web search in Microsoft Copilot and Microsoft Copilot Chat · Microsoft Learn. Documentation officielle. Consulté le . À l’appui de : « Microsoft Copilot analyse la demande, repère les termes pour lesquels le web améliorerait la réponse et génère une courte requête envoyée au service Bing, différente de la demande d’origine. La page concerne Microsoft 365 Copilot (usage en entreprise), pas forcément l’application grand public. »
- Tools: Web Search · xAI. Documentation officielle. Consulté le . À l’appui de : « Dans l’API de xAI, le modèle décide d’appeler l’outil de recherche web quand c’est utile, peut le faire plusieurs fois, navigue dans des pages en temps réel et intègre des citations à la réponse. La page décrit l’API, pas l’application Grok, et ne dit pas les critères de choix. »
Auteur et journal des modifications#
- Auteur
- L’équipe GeoMetrick
- Relecteur
- Esteban, associé de GeoMetrick
- Publié le
- Dernière mise à jour
- Prochaine revue au plus tard
Journal des modifications
- : Rédaction assistée par un agent à partir des sources citées sur cette page (protocole seul, aucun résultat) ; titre et contenu à compléter quand les mesures auront été lancées et validées.
- : Publication décidée par Esteban (GeoMetrick) après la vérification de chaque affirmation par rapport à sa source (rapport du 02/10/2026) ; les mesures annoncées restent à produire et seront ajoutées à mesure.