Méthodologie · Mesure de la visibilité dans les IA
Comment nous mesurons, et pourquoi vous pouvez le vérifier
Un score n’a de valeur que si l’on sait comment il est calculé, sur combien de réponses, avec quelle marge d’erreur, et ce qu’il ne dit pas. Cette page le dit en langage courant : nos règles de mesure, les poids du score GEO et leurs justifications, nos limites, et les erreurs que nous avons corrigées depuis.
Nous ne publions ni les questions posées pour un client, ni nos consignes aux IA. Nous publions ce qui permet de juger si la mesure est fiable.
Sommaire de la page
- Pourquoi répéter chaque question
- La fourchette de confiance
- Le score GEO : six composantes
- Le consensus entre IA
- La vérification des faits
- Quand nous n’affichons pas de score
- Ce que nous ne mesurons pas
- Journal des versions de la méthode
- Pourquoi publier tout cela
- Comment vérifier, avec ou sans nous
- Questions fréquentes
- Sources
Pourquoi ne jamais mesurer une seule fois#
Une IA ne répond pas deux fois de la même façon. Même question, même IA : la liste des marques citées change, leur ordre aussi. Une étude de janvier 2026 (600 volontaires, 12 questions, 2 961 réponses sur ChatGPT, Claude et l’IA de Google) a trouvé moins d’une chance sur 100 d’obtenir deux fois la même liste de marques.[1] Une mesure unique est une anecdote.
Notre règle : chaque question est posée plusieurs fois à chaque IA, et les résultats sont regroupés par question. Ce que nous affichons n’est jamais « l’IA vous a cité », mais « l’IA vous cite dans tel pourcentage de ses réponses, sur tel nombre de réponses ». C’est la fréquence d’apparition que nous mesurons, pas une place dans un classement : les auteurs de l’étude concluent que le rang d’une marque dans une liste n’est pas fiable, alors que la fréquence d’apparition, sur de nombreuses réponses, est une mesure raisonnable.[1]
La variabilité côté clients
Deux personnes qui veulent la même chose n’écrivent pas la même question. SparkToro a mesuré que des questions rédigées par des humains pour une même intention se ressemblaient très peu (similarité sémantique moyenne de 0,081), tout en faisant revenir des groupes de marques semblables.[2] Nos questions sont donc un échantillon représentatif d’une intention, pas l’ensemble des formulations possibles. C’est une limite de toute mesure, la nôtre comprise.
Ce qu’est une fourchette de confiance#
Un pourcentage mesuré sur un échantillon n’est pas la vraie valeur : c’est une estimation. La fourchette de confiance (ou intervalle de confiance à 95 %) indique la zone où se trouve très probablement la vraie valeur. Si l’on répétait la mesure avec d’autres échantillons de questions du même type, les fourchettes ainsi construites contiendraient la vraie valeur dans environ 95 % des cas.
Ce que montrent la plupart des outils, et ce que nous montrons
22 % de réponses citant la marque, présentés de deux façons.
Exemples illustratifs : marques et chiffres inventés.
Comment la lire
- Fourchette courte : beaucoup de réponses, résultat solide.
- Fourchette large : peu de questions. Ce n’est pas un défaut de l’outil : c’est l’information.
- Deux fourchettes qui se chevauchent ne prouvent pas que deux mesures ne diffèrent pas : ce n’est pas un test de différence. Nous le précisons pour éviter de sur-interpréter un écart entre deux audits.
Ce que la fourchette dit : de combien le score aurait pu varier si l’audit avait posé un autre échantillon de questions du même type. Ce qu’elle ne dit pas : que le score est « juste ». Elle ne couvre ni les biais de la mesure (questions, versions de modèles, période) ni la valeur du score pour votre activité.
Pourquoi nos fourchettes sont plus larges qu’un calcul simple
Les réponses de toutes les IA à une même question se ressemblent. Les traiter comme des réponses indépendantes donnerait une fourchette trop étroite, donc trompeuse. Nous prenons donc les questions, et non les réponses, comme unité : nous refaisons le calcul complet des milliers de fois en tirant au hasard, avec remise, une partie des questions (méthode de rééchantillonnage dite du bootstrap), puis nous lisons la fourchette dans la distribution obtenue, avec une correction prévue pour les petits nombres de questions.[3][4][5]
Un exemple où la différence se voit
12 questions, posées 5 fois chacune, marque jamais citée : 0 citation sur 60 réponses.
Ce que nous avons vérifié, et ce que nous n’avons pas vérifié
Nous avons testé la méthode par simulation, sur une population de 4 000 questions dont le score vrai est connu, dans quatre scénarios (marque peu, moyennement ou très citée, avec de fortes corrélations entre questions). Les fourchettes à 95 % ont contenu la vraie valeur dans 94,7 à 98,5 % des cas selon le nombre de questions, alors qu’une méthode plus simple, avec 8 à 10 questions, ne le faisait que dans 90 à 93 % des cas. Ce sont nos propres résultats de simulation, pas ceux d’une étude extérieure.
Références de la méthode : Efron et Tibshirani (1993) pour le rééchantillonnage ; Field et Welsh (2007) et Cameron, Gelbach et Miller (2008) pour le traitement de données regroupées, et pour les risques d’une fourchette trop étroite quand les groupes sont peu nombreux ; Hesterberg (2015) pour les corrections sur petits échantillons.[6]
Le score GEO : six composantes et leurs poids#
Le score GEO est un indicateur composite sur 100. Il additionne six composantes, chacune ramenée entre 0 et 1 puis multipliée par son poids. Le résultat est arrondi, et il est traduit en une note de A à F, affichée selon le niveau de l’échantillon (voir plus bas). Voici les poids, ce que mesure chaque composante, et pourquoi ce poids.
Répartition des 100 points
Poids en vigueur depuis le 27 août 2026.
- Présence : 30 points
- Proéminence : 15 points
- Part de voix : 20 points
- Sentiment : 20 points
- Cohérence entre IA : 10 points
- Couverture des citations : 5 points
Présence
La part des réponses où votre marque est citée.
Pourquoi ce poids : la quasi-unanimité des outils comparables que nous avons étudiés en août 2026 en font leur indicateur principal. Elle est donc la plus lourde du score. Aucun d’eux ne publie une répartition en points identique à la nôtre : « 30 » précisément n’est validé par personne, seule la hiérarchie (la plus importante) l’est.
Hiérarchie appuyée, chiffre non validéProéminence
L’endroit de la réponse où la marque apparaît : dès le début, ou reléguée en fin de texte.
Pourquoi ce poids : c’est la composante à la preuve la plus faible, donc elle a été réduite (de 25 à 15). La littérature publiée mesure un concept voisin, la position d’une source parmi celles citées dans une réponse,[7] pas l’endroit où une marque apparaît dans le texte d’une réponse. C’est une extrapolation raisonnable, pas une preuve directe. Et le rang d’une marque dans une liste est peu fiable d’une réponse à l’autre,[1] ce qui plaide pour un poids modeste.
Composante la moins solidePart de voix
Votre part des mentions, parmi toutes les marques citées (la vôtre et ses concurrents) dans les mêmes réponses.
Pourquoi ce poids : valeur d’origine, inchangée. Aucune preuve pour ou contre un autre chiffre. Le seul repère publié comparable que nous ayons trouvé, l’outil de notation d’un éditeur de logiciels marketing, la pondère moins (10 points sur 100).[8]
Aucune preuve pour ou contreSentiment
Comment l’IA parle de vous : positivement, de façon neutre, négativement, ou en disant des choses fausses. Les mentions positives font monter cette composante ; les négatives, et plus encore les affirmations fausses, la font descendre.
Pourquoi ce poids : monté de 10 à 20, c’est le changement le mieux justifié. Deux preuves convergentes, détaillées plus bas.
Deux preuves convergentesCohérence entre IA
Les IA sont-elles d’accord entre elles sur votre marque, qu’elles la citent toutes ou qu’aucune ne la cite ?
Pourquoi ce poids : aucun des six outils comparables étudiés n’en fait un pilier chiffré de son score. Cela ne prouve pas que c’est sans importance, seulement que le marché ne la mesure pas encore ainsi. Valeur d’origine conservée par prudence.
Aucune preuve pour ou contreCouverture des citations
La part des réponses qui citent votre propre site parmi leurs sources.
Pourquoi ce poids : cette composante avait disparu du calcul sans explication écrite. Réintroduite : le signal était déjà calculé ailleurs dans le rapport (vous êtes cité, mais sans lien vers votre site) et n’avait aucune raison d’en rester à l’écart du score.
Poids d’origine rétabliPourquoi 20 pour le sentiment, et pas 10
Deux preuves indépendantes.
- Un test de cohérence sur deux profils simulés (un simple calcul, sans appeler d’IA). Profil A : cité 90 % du temps, mais avec 70 % de mentions fausses ou négatives. Profil B : cité seulement 15 % du temps, mais avec 100 % de mentions positives et 100 % de cohérence entre IA. Avec l’ancienne pondération (10 points de sentiment), le profil A obtenait 78 sur 100, presque autant qu’une marque irréprochable, et le profil B 52, moins qu’une marque très mal décrite. C’était l’inverse de ce que le produit cherche à montrer. Avec la pondération actuelle, les deux profils obtiennent 67 et 60.
- Un repère externe : l’outil de notation publié par un éditeur de logiciels marketing donne au sentiment le poids le plus élevé de son score (40 points sur 100), en expliquant qu’il mesure comment l’IA caractérise votre marque, pas seulement si elle vous reconnaît.[8] C’est le choix éditorial d’une entreprise, pas une étude : il prouve qu’une autre pondération professionnelle et défendable existe, pas que 20 (ou 40) est le bon chiffre.
Nous avons aussi écarté plusieurs statistiques séduisantes trouvées en cours de recherche (un impact chiffré des erreurs d’IA sur le support client, un « désaccord de 62 % entre modèles ») : elles n’ont pas résisté à la vérification sur la source d’origine. Nous avons préféré les écarter plutôt que les citer.
Ce que le score ne dit pas
- Aucun de ces poids n’a de preuve de corrélation directe et chiffrée avec un résultat réel.
- La proéminence, telle que nous la mesurons, n’est pas prouvée équivalente à celle de la littérature : c’est le point le plus fragile de la formule.
- Le repère externe sur le sentiment est un choix éditorial, pas une démonstration.
- Le score est un signal composite : il donne une tendance rapide et permet de suivre une évolution. Il n’est pas une vérité absolue, et il sera revu si de meilleures preuves apparaissent (étude sur nos propres audits, nouvelle littérature).
Le consensus entre IA#
Plusieurs IA qui disent la même chose sont un signal ; des IA qui se contredisent en sont un autre. Nous mesurons à quel point les IA sont d’accord entre elles sur votre marque. Une marque que toutes les IA citent et une marque qu’aucune ne cite reçoivent le même maximum : dans les deux cas, les IA sont unanimes. Le minimum correspond à un partage moitié-moitié, le seul cas de vrai désaccord.
Ce n’était pas ainsi au départ. Jusqu’au 23 septembre 2026, le calcul confondait accord et présence : une marque absente de toutes les IA obtenait zéro sur cette composante, alors que les IA étaient parfaitement d’accord entre elles. La composante doublait donc, presque toujours, celle de la présence. Nous l’avons corrigée.
La vérification des faits#
Être cité ne suffit pas : encore faut-il que ce que dit l’IA soit vrai. Pour chaque marque, nous construisons une fiche de faits : horaires, adresse, téléphone, prix, produits, dirigeants, établissements. Elle provient de trois sources : votre site, vos fiches (Google, plateformes de livraison ou de réservation) et des registres publics (base Sirene des entreprises, annonces légales du BODACC, Wikidata, OpenStreetMap, IGN).
Les écarts entre ces sources sont proposés, puis validés par une personne (vous, ou notre équipe selon l’offre) : rien n’entre dans la fiche sans validation. Chaque affirmation vérifiable d’une IA (un horaire, une adresse, un prix) est ensuite comparée à cette fiche ; un écart est signalé avec la source de la bonne information, pour que vous sachiez où corriger.
Les pièges que nous connaissons
- Les réseaux et les franchises : dans les registres publics, l’entreprise immatriculée est l’exploitant (par exemple un franchisé), pas l’enseigne. Nous cherchons donc sur l’enseigne, et chaque rapprochement est proposé avant d’être retenu.
- Un fait absent de la fiche n’est pas vérifié : nous ne le déclarons ni juste ni faux. Quand une information manque, nous l’écrivons au lieu de la deviner.
- La fiche est aussi bonne que ses sources et que votre validation : c’est pourquoi vous la relisez.
Quand nous n’affichons pas de score#
Un score calculé sur trop peu de réponses est une fausse précision. Nos règles d’affichage :
- Trois niveaux. En dessous d’un certain nombre de réponses, aucune note n’est affichée : l’échantillon est insuffisant, et nous l’écrivons. Au-dessus, la note est affichée avec la mention « indicatif ». À partir d’un volume plus important, elle est ferme.
- Pas de fourchette dans quatre cas : échantillon trop petit ; une seule question ; toutes les questions donnent exactement le même résultat (une fourchette de largeur nulle serait une précision fabriquée) ; données qui ne permettent pas de contrôler le calcul. Dans chaque cas, la raison est écrite.
- Les extrêmes sont dits, pas masqués. « Jamais citée sur 12 questions » est une vraie information : nous l’affichons avec une borne prudente (par exemple « 0 sur 12 questions, jusqu’à 24 % »), sans fabriquer de fourchette.
- Les audits antérieurs au 30 septembre 2026 n’ont pas de fourchette et ne sont pas recalculés : l’absence de fourchette y veut dire « pas encore calculée », pas « impossible ».
Ce que nous ne mesurons pas, et les limites#
- Un test indépendant ne remplace pas votre jugement. Nous mesurons ce que disent les IA de votre marque sur un échantillon de questions. Vous connaissez votre marché et vos clients. Le score donne une tendance, pas un verdict.
- Les IA changent. Versions de modèles, index de recherche et règles d’affichage évoluent ; OpenAI précise lui-même que les résultats et citations de ChatGPT peuvent être incomplets, périmés ou incorrects.[9] La fourchette ne couvre pas ces changements : c’est pourquoi nous datons chaque mesure et la rejouons avec le même protocole.
- Nous interrogeons des interfaces de programmation (API), pas l’application grand public. Les réponses peuvent différer de celles que voit un client sur son téléphone (modèle, réglages, localisation, historique). Selon l’IA et le protocole, nous mesurons le modèle seul (ce qu’il sait), le modèle avec sa recherche web (ce qu’il trouve et cite), ou les deux. Pour Copilot, nous relevons ce que la recherche Bing, à laquelle Copilot est associé, affiche pour la question : ce n’est pas une réponse de Copilot. Les Aperçus IA de Google ne s’affichent pas toujours ;[10] quand Google n’en affiche pas, nous l’enregistrons tel quel.
- Nos questions sont un échantillon, pas toutes les formulations possibles (voir plus haut).
- Aucun lien prouvé avec votre chiffre d’affaires. Nous ne disons pas qu’un point de score vaut un nombre de clients.
- Nous ne mesurons pas ce que voit une personne donnée : localisation, historique et compte personnel influencent les réponses.[9]
- Une fourchette n’est pas un test de différence entre deux audits (voir plus haut).
Journal des versions de la méthode#
Une méthode qui n’a jamais été corrigée n’a probablement jamais été relue. Voici les corrections que nous avons faites, dans l’ordre. Tout changement de poids fait l’objet d’une entrée écrite : composante concernée, ancienne et nouvelle valeur, preuve. Si le calcul et la documentation divergent sans explication, nous le traitons comme une erreur.
| Date | Changement | Pourquoi, et quelle preuve |
|---|---|---|
| 27/08/2026 | Correction des poids. Les poids réellement appliqués s’écartaient, depuis la toute première version, de la méthode documentée au départ, sans qu’aucune trace écrite explique l’écart. Nous les avons rétablis ou justifiés un par un (tableau ci-dessous). | Un test de cohérence sur deux profils simulés et un repère externe (voir « Pourquoi 20 pour le sentiment »). Chaque poids a désormais sa justification écrite. |
| 23/09/2026 | Correction du consensus entre IA. Une marque absente de toutes les IA obtenait zéro, alors que les IA étaient unanimes. Le calcul est désormais symétrique : l’unanimité d’absence vaut l’unanimité de présence. | Une démonstration logique, pas une étude externe. Avant la correction, cette composante doublait presque toujours celle de la présence. |
| 30/09/2026 | Fourchettes de confiance ajoutées au score et à la présence de chaque IA. Le score, sa formule, ses poids et sa note ne changent pas : la fourchette est calculée à côté. Les cas extrêmes (0 % ou 100 %, largeur nulle) sont traités. | Test par simulation (voir « La fourchette de confiance »). Les audits antérieurs ne sont pas recalculés. |
Détail de la correction du 27 août 2026
| Composante | Méthode documentée au départ | Réellement appliqué jusqu’au 27/08/2026 | Depuis |
|---|---|---|---|
| Présence | 30 | 40 | 30 |
| Proéminence | 20 | 25 | 15 |
| Part de voix | 20 | 20 | 20 |
| Sentiment | 15 | 10 | 20 |
| Cohérence entre IA | 10 | 5 | 10 |
| Couverture des citations | 5 | absente | 5 |
| Total | 100 | 100 | 100 |
Le consensus a ensuite été corrigé le 23/09/2026 (changement de calcul, pas de poids).
Pourquoi publier tout cela#
Publier sa méthode n’est pas la norme. CitedIndex, un annuaire d’outils de visibilité dans les IA qui se présente comme neutre, a examiné les pages publiques de 74 outils à la recherche de ce qui permet de vérifier une précision annoncée (taille d’échantillon, formule, jeu de données, étude, code). Résultat : 6 outils sur 74 (8 %) publient de quoi vérifier leur méthode ; 36 (49 %) annoncent une précision sans support trouvé ; 32 (43 %) n’en annoncent aucune. Le recensement a été publié le 07/08/2026 et mis à jour le 05/09/2026.[11]
Nous ne nous plaçons donc pas au-dessus des autres. Nous publions la nôtre pour que vous puissiez la critiquer, avec ses points faibles, ses corrections et ses limites.
Comment vérifier, avec ou sans nous#
Huit questions à poser à n’importe quel outil de mesure de la visibilité dans les IA, le nôtre compris :
- Combien de fois chaque question est-elle posée à chaque IA ?
- Chaque pourcentage est-il accompagné du nombre de réponses et d’une fourchette ?
- Que fait l’outil quand l’échantillon est trop petit : il affiche un chiffre quand même, ou il le dit ?
- Les poids du score sont-ils publiés, avec leur justification et leurs limites ?
- L’outil interroge-t-il l’application grand public ou une interface de programmation, avec quel modèle, et à quelle date ?
- Les erreurs des IA sont-elles comparées à une source de vérité que vous pouvez relire ?
- Un changement de méthode est-il daté et expliqué ?
- L’outil vous vend-il un « classement » dans une IA ? Les positions sont instables d’une réponse à l’autre,[1] et aucun outil tiers n’a accès aux systèmes internes d’un éditeur d’IA.[12]
Vous pouvez aussi faire la vérification à la main : posez dix de vos questions à trois IA, plusieurs fois chacune, et comparez avec la fourchette d’un rapport. Le guide « Qu’est-ce que le GEO ? » décrit la démarche pas à pas.
Questions fréquentes#
Le score GEO est-il validé scientifiquement ?
Non, et nous le disons. Le secteur est trop récent pour qu’une étude mesure le lien entre chacun de ses signaux et un résultat réel comme le chiffre d’affaires. Les poids du score sont argumentés : chacun a une justification écrite, publiée sur cette page avec ses limites. Le score donne une tendance et permet de suivre une évolution ; ce n’est pas une vérité absolue.
Pourquoi ne voyez-vous pas de score pour ma marque ?
Parce que l’échantillon est trop petit. Un score calculé sur trop peu de réponses est une fausse précision : nous l’écrivons au lieu de l’afficher. Au-dessus d’un premier seuil, le score est affiché avec la mention « indicatif » ; à partir d’un volume plus important, il est ferme. Nous ne fabriquons jamais une fourchette : quand il n’y en a pas, la raison est écrite.
Que signifie la fourchette à côté d’un pourcentage ?
C’est la zone où se trouve très probablement la vraie valeur : si l’on refaisait la mesure avec d’autres questions du même type, le résultat resterait dans cette zone dans la grande majorité des cas. Plus la zone est courte, plus le chiffre est sûr. Elle ne mesure pas les biais de la mesure (formulation des questions, version des modèles, période).
Mesurez-vous l’application ChatGPT que j’utilise ?
Non. Nous interrogeons les IA par l’interface de programmation (API) de leurs éditeurs. Leurs réponses peuvent différer de celles de l’application grand public : modèle, réglages, localisation, historique. Selon l’IA et le protocole, nous mesurons le modèle seul, le modèle avec sa recherche web, ou les deux. C’est une limite de la méthode, indiquée sur cette page.
Pourquoi n’affichez-vous pas de volume de recherche pour les questions posées aux IA ?
Parce qu’aucun éditeur d’IA ne publie le nombre de fois où une question lui est posée : il n’existe pas d’équivalent des volumes de recherche de Google, seulement des estimations de tiers, modélisées à partir d’échantillons d’utilisateurs, et nous n’en affichons aucune pour ne pas ajouter de fausse précision. Nous mesurons autre chose, et nous le disons : ce que chaque IA répond à un jeu de questions défini sur votre marque et votre marché, posées plusieurs fois, avec le nombre de réponses et la fourchette de chaque chiffre. Un résultat signifie donc « quand cette question est posée, voici ce que l’IA répond et avec quelle régularité », pas « tant de personnes la posent ». C’est une limite de la méthode. Pour savoir ce que vos visiteurs cherchent sur Google, la source reste votre Search Console.
Pourquoi poser plusieurs fois la même question ?
Parce qu’une IA ne répond jamais deux fois pareil. Dans une étude de janvier 2026 sur 2 961 réponses, il y avait moins d’une chance sur 100 d’obtenir deux fois la même liste de marques. Une réponse isolée est donc une anecdote ; seule la fréquence d’apparition sur de nombreuses réponses a un sens.
Vos poids peuvent-ils changer ?
Oui, et chaque changement est daté et justifié dans le journal des versions. Tout changement de poids fait l’objet d’une entrée écrite : composante concernée, ancienne et nouvelle valeur, preuve. Si le calcul et la documentation divergent sans explication, nous le traitons comme une erreur, pas comme une évolution acceptable.
Puis-je vérifier ou contester une mesure ?
Oui, c’est le but d’une méthode publique. Reposez vous-même les mêmes questions à la même IA, plusieurs fois, et comparez avec la fourchette affichée. Si votre résultat sort nettement de cette fourchette, écrivez-nous : nous vérifions et, si c’est une erreur de notre part, nous la corrigeons et nous la datons dans le journal.
Sources#
Consultées le 30/09/2026. Les dates sont celles de publication ou de mise à jour lues sur la page ; les réserves propres à chaque source sont indiquées.
- R. Fishkin (SparkToro) et P. O’Donnell (Gumshoe.ai), « New research: AIs are highly inconsistent when recommending brands or products » · 27/01/2026. Consulté le 30/09/2026. Étude de praticiens (non académique) : 600 volontaires, 12 questions, 2 961 réponses sur ChatGPT, Claude et Google IA ; l’un des auteurs est cofondateur d’un éditeur d’outil de suivi de la visibilité dans les IA (conflit d’intérêts reconnu par l’auteur principal) ; les auteurs listent leurs limites (échantillon modeste, nombre de répétitions nécessaire non établi, appels d’API pas forcément représentatifs).
- SparkToro, « Why everyone prompts AI differently (even when they want the same thing) » · 11/02/2026. Consulté le 30/09/2026.
- B. Efron et R. Tibshirani, An Introduction to the Bootstrap, Chapman and Hall, 1993 · 1993. Consulté le 30/09/2026.
- T. Hesterberg, « What teachers should know about the bootstrap: resampling in the undergraduate statistics curriculum », The American Statistician 69(4), 2015, p. 371-386 · 2015. Consulté le 30/09/2026.
- C. A. Field et A. H. Welsh, « Bootstrapping clustered data », Journal of the Royal Statistical Society B 69(3), 2007, p. 369-390 · 2007. Consulté le 30/09/2026.
- A. C. Cameron, J. B. Gelbach, D. L. Miller, « Bootstrap-based improvements for inference with clustered errors », Review of Economics and Statistics 90(3), 2008, p. 414-427 · 2008. Consulté le 30/09/2026.
- P. Aggarwal, V. Murahari, T. Rajpurohit, A. Kalyan, K. Narasimhan, A. Deshpande, « GEO: Generative Engine Optimization », conférence KDD 2024 (arXiv 2311.09735) · soumis le 16/11/2023, dernière version le 28/06/2024. Consulté le 30/09/2026. Expériences sur un moteur génératif simulé (GPT-3.5) et sur Perplexity.ai ; résultats variables selon les domaines.
- HubSpot, « AI Search Grader » (pondération publiée de l’outil) · page consultée le 30/09/2026. Choix éditorial d’une entreprise, publié par elle ; ce n’est pas une étude.
- OpenAI, centre d’aide, « Searching the web with ChatGPT » · page consultée le 30/09/2026.
- Google Search Central, « AI features and your website » · page indiquant une mise à jour le 10/12/2025. Consulté le 30/09/2026.
- CitedIndex, « Which AI-visibility tools show their work? A methodology census » · publié le 07/08/2026, mis à jour le 05/09/2026. Consulté le 30/09/2026. L’auteur précise ne pas avoir exécuté les outils ni testé leurs scores : c’est un inventaire de transparence, pas un classement de précision.
- Google Search Central, « Optimizing your website for generative AI features on Google Search » · mis à jour le 10/07/2026. Consulté le 30/09/2026.
Pour aller plus loin
Analyse gratuite
Voir la méthode sur votre marque
Collez l’adresse de votre site : premier constat en 2 minutes, sans carte bancaire.