Journal · Mesurer
Pourquoi une IA ne répond jamais deux fois pareil
Une IA varie d’une réponse à l’autre, même sans hasard apparent. Pourquoi, et comment lire une mesure avec ses répétitions et sa fourchette de confiance.
Sommaire de la page
- Deux raisons de varier : le hasard et le calcul
- Ce que cela change : on mesure une fréquence, pas une réponse
- La fourchette : pourquoi Wilson plutôt qu’un calcul simple
- Combien de répétitions : deux pièges
- Ce que la fourchette ne dit pas
- La mesure que nous préparons : vingt-cinq répétitions d’une même question (à produire)
- Ce que nous avons mesuré
- Ce que nous ne savons pas
- Questions fréquentes
- Sources
- Auteur et journal des modifications
- À lire ensuite
Deux raisons de varier : le hasard et le calcul#
Une IA ne répond pas deux fois pareil parce que la génération de texte comporte une part d’échantillonnage, et que même sans hasard apparent le calcul réalisé sur les serveurs peut varier d’une exécution à l’autre. La documentation d’Azure OpenAI le dit simplement : par défaut, poser la même question plusieurs fois donne probablement des réponses différentes.[3]
Le non-déterminisme persiste même quand on demande au modèle d’être le moins aléatoire possible. Avec un modèle ouvert et une température de zéro, 1 000 complétions du même énoncé ont donné 80 textes distincts, identiques jusqu’au 102e jeton puis divergents.[1] Selon les auteurs, la cause principale est que les calculs dépendent de la taille du lot traité par le serveur, donc de sa charge, et pas seulement de l’ordre des opérations en virgule flottante ; avec des noyaux insensibles à la taille du lot, les 1 000 sorties deviennent identiques.[1]
| Levier | Ce que disent les sources | Ce que cela change pour une mesure |
|---|---|---|
| Poser deux fois la même question | Des réponses probablement différentes par défaut.[3] | Une réponse est une instance, pas un résultat. |
| Mettre la température à zéro | Des textes distincts subsistent sur un modèle ouvert.[1] | Aucune certitude d’obtenir une réponse identique. |
| Fixer une graine | Un échantillonnage déterministe « au mieux », sans engagement de résultat ; une empreinte du système permet de repérer un changement de configuration.[4] Chez Azure OpenAI, pas de déterminisme assuré même à graine et empreinte identiques, et moins de reproductibilité pour les longues réponses.[3] | Des sorties plus homogènes, pas identiques. |
| Régler la température | Sur les modèles publiés après Claude Opus 4.6, l’API de Claude n’accepte plus que la valeur 1,0.[5] | On ne peut pas figer le hasard par ce moyen sur ces modèles. |
La source sur le calcul des serveurs porte sur un modèle ouvert : elle ne dit rien des services grand public ni de la variation du contenu d’une réponse sur une marque.[1]
Ce que cela change : on mesure une fréquence, pas une réponse#
Si chaque réponse est une instance, ce qui se mesure est la fréquence avec laquelle une marque ou un fait apparaît sur un ensemble de réponses. Une étude sur la presse publiée par le Tow Center prend ses réponses comme des instances uniques alors qu’elles varient, et le note parmi ses limites.[6] À l’inverse, l’étude GEO échantillonne cinq réponses par requête.[7]
Notre règle : chaque question est posée plusieurs fois à chaque IA, et les résultats sont regroupés par question. Ce que nous affichons n’est jamais « l’IA vous a cité », mais « l’IA vous cite dans tel pourcentage de ses réponses, sur tel nombre de réponses ». C’est la fréquence d’apparition que nous mesurons, pas une place dans un classement.
La fourchette : pourquoi Wilson plutôt qu’un calcul simple#
Un pourcentage observé sur un échantillon est une estimation, pas la vraie valeur. La fourchette de confiance indique la zone où se trouve très probablement la vraie valeur ; plus elle est étroite, plus la mesure est précise.
Pour une proportion, le calcul enseigné partout (l’intervalle de Wald) a une probabilité de couverture erratique. Pour les petits échantillons, une étude statistique de référence recommande l’intervalle de Wilson ou celui de Jeffreys ; pour les grands, celui d’Agresti-Coull.[2] L’intervalle de Wilson est asymétrique et évite les largeurs nulles et les bornes hors de 0 à 100 %.[8] Une bibliothèque statistique courante propose six méthodes et ne présente pas Wilson comme supérieure dans l’absolu : nommer la méthode utilisée la rend reproductible.[9]
Le tableau suivant est un calcul, pas une mesure : il applique la formule de Wilson, à 95 %, à une fréquence observée de 20 % puis à zéro citation, pour différents nombres de réponses supposées indépendantes.[2]
| Réponses (supposées indépendantes) | Citations observées | Fréquence observée | Fourchette de Wilson à 95 % | Calcul simple (Wald) à 95 % |
|---|---|---|---|---|
| 5 | 1 | 20 % | 3,6 % à 62,4 % | -15,1 % à 55,1 % (borne négative) |
| 10 | 2 | 20 % | 5,7 % à 51,0 % | -4,8 % à 44,8 % (borne négative) |
| 25 | 5 | 20 % | 8,9 % à 39,1 % | 4,3 % à 35,7 % |
| 100 | 20 | 20 % | 13,3 % à 28,9 % | 12,2 % à 27,8 % |
| 400 | 80 | 20 % | 16,4 % à 24,2 % | 16,1 % à 23,9 % |
| 25 | 0 | 0 % | 0 % à 13,3 % | 0 % à 0 % (largeur nulle) |
Comment lire ce tableau. Sur cinq réponses, une seule citation donne une fourchette de près de soixante points de large : ce n’est pas un défaut du calcul, c’est l’information. Et zéro citation sur vingt-cinq réponses ne prouve pas que la fréquence est nulle : elle reste compatible avec une fréquence allant jusqu’à environ 13 %, alors que le calcul simple affiche une largeur nulle.[2]
Combien de répétitions : deux pièges#
La précision dépend du nombre de réponses. Au pire cas, quand la fréquence observée est proche de la moitié, la fourchette de Wilson à 95 % mesure environ vingt points de large pour cent réponses indépendantes (calcul à partir de la formule), et environ dix points pour quatre cents.[2] Il n’existe donc pas un nombre de répétitions « suffisant » : il y a une précision que l’on veut, et un nombre de réponses qui la permet.
Les répétitions ne sont pas indépendantes. Ce calcul suppose des réponses indépendantes.[2] Or cette indépendance n’est pas démontrée pour des répétitions d’une même question, ni entre IA : nous ne savons pas dans quelle mesure leurs réponses à une même question se ressemblent. Vingt-cinq répétitions d’une même question ne valent donc pas vingt-cinq observations indépendantes. C’est pourquoi nous prenons les questions, et non les réponses, comme unité : la taille effective de l’échantillon est bornée par le nombre de questions, et nos fourchettes sont plus larges qu’un calcul simple. Le détail est sur la page Méthodologie.
Ce que la fourchette ne dit pas#
Une fourchette dit de combien le résultat aurait pu varier si l’on avait posé un autre échantillon de questions du même type. Elle ne dit pas que le résultat est « juste ». Elle ne couvre ni un changement de version de modèle, ni la période, ni la formulation des questions : c’est pourquoi chaque mesure est datée et rejouée avec le même protocole. Deux fourchettes qui se chevauchent ne prouvent pas non plus que deux mesures ne diffèrent pas.
La mesure que nous préparons : vingt-cinq répétitions d’une même question (à produire)#
Cette partie décrit un protocole. Aucun résultat n’est publié ici.
Nous poserons la même question vingt-cinq fois à une même IA, dans le même mode et le même jour, et nous publierons la distribution complète : combien de listes de marques différentes sont obtenues, avec quelle fréquence chaque marque apparaît, et à partir de combien de répétitions cette fréquence cesse de bouger. Le résultat sera donné par IA, avec le nombre de réponses, la date, la langue, la fourchette de confiance et les limites.
Ce que nous ne dirons pas à partir de cette mesure : que le nombre de répétitions retenu vaut pour toutes les questions, ni que la variabilité observée par API est celle de l’application grand public.
Ce que nous avons mesuré#
Ce que nous ne savons pas#
Questions fréquentes#
Pourquoi une IA ne répond-elle pas deux fois pareil ?
Parce que la génération de texte comporte une part d’échantillonnage et que, même à température nulle, le calcul sur les serveurs peut varier d’une exécution à l’autre. Les éditeurs eux-mêmes n’assurent pas des sorties identiques, même avec une graine.
Peut-on fixer la réponse d’une IA avec la température ou une graine ?
Pas de façon sûre : une graine rend les sorties plus homogènes sans assurer le déterminisme, et certains modèles récents n’acceptent plus de réglage de la température. La répétition reste donc l’outil de mesure.
Combien de fois faut-il poser la même question ?
Cela dépend de la précision voulue : plus il y a de réponses, plus la fourchette se resserre. Mais des répétitions d’une même question ne sont pas des observations indépendantes, c’est pourquoi nous publions le nombre de réponses et la fourchette de chaque résultat.
Qu’est-ce que l’intervalle de Wilson ?
C’est une méthode de calcul de la fourchette d’une proportion, recommandée pour les petits échantillons par une étude statistique de référence. Elle évite les bornes négatives et les largeurs nulles du calcul simple.
Sources#
- Defeating Nondeterminism in LLM Inference · Horace He et Thinking Machines Lab. Étude. Consulté le . À l’appui de : « Même à température 0, 1 000 complétions du même énoncé avec un modèle ouvert donnent 80 textes distincts, identiques jusqu’au 102e jeton puis divergents ; selon les auteurs, la cause principale est la dépendance des calculs à la taille du lot traité (donc à la charge du serveur), pas seulement l’ordre des opérations flottantes ; avec des noyaux insensibles à la taille du lot, les 1 000 sorties deviennent identiques. La source ne dit rien des services grand public ni de la variation du contenu d’une réponse sur une marque. »
- Interval Estimation for a Binomial Proportion · Brown, Cai, DasGupta, Statistical Science 16(2), 2001. Étude. Consulté le . À l’appui de : « Pour une proportion, le comportement de la probabilité de couverture de l’intervalle de Wald, enseigné partout, est erratique ; pour les petits échantillons, Brown, Cai et DasGupta recommandent l’intervalle de Wilson ou l’intervalle de Jeffreys à queues égales, et pour les grands celui d’Agresti-Coull. Cet article ne porte pas sur les modèles de langage et suppose des essais indépendants. »
- How to generate reproducible output with Azure OpenAI in Microsoft Foundry Models (classic) · Microsoft Learn. Documentation officielle. Consulté le . À l’appui de : « Par défaut, poser la même question plusieurs fois à un modèle d’Azure OpenAI donne probablement des réponses différentes ; une graine rend les sorties plus homogènes, mais le déterminisme n’est pas garanti, même avec graine et empreinte identiques, et plus la réponse est longue, moins elle est reproductible (fonction en préversion). »
- How to make your completions outputs reproducible with the new seed parameter · OpenAI Cookbook. Documentation officielle. Consulté le . À l’appui de : « Chez OpenAI, le paramètre seed vise un échantillonnage déterministe au mieux, sans garantie ; system_fingerprint identifie la configuration serveur pour repérer un changement d’infrastructure serveur qui pourrait modifier le résultat. »
- Messages · Anthropic. Documentation officielle. Consulté le . À l’appui de : « Dans l’API de Claude, les modèles publiés après Claude Opus 4.6 ne permettent plus de régler la température : seule la valeur 1,0 est acceptée pour la compatibilité, les autres sont rejetées. »
- AI Search Has a Citation Problem · Columbia Journalism Review (Tow Center for Digital Journalism). Étude. Consulté le . À l’appui de : « Le Tow Center (Columbia Journalism Review, mars 2025) a testé huit outils de recherche générative sur 1 600 requêtes de presse. Parmi ses limites déclarées : les réponses sont prises comme des instances uniques alors qu’elles varient ; les requêtes ne sont pas répétées. »
- GEO: Generative Engine Optimization · Aggarwal et al. (Princeton et autres), arXiv. Étude. Consulté le . À l’appui de : « L’étude GEO (Princeton et autres, KDD ’24 d’après le pied de page du PDF) échantillonne cinq réponses par requête avec une température de 0,7. »
- Binomial proportion confidence interval · Wikipédia (en anglais). Presse ou billet. Consulté le . À l’appui de : « L’intervalle de Wilson (E. B. Wilson, 1927) est asymétrique, évite les intervalles de largeur nulle et les bornes hors de 0 à 1, et se comporte bien pour les petits échantillons et les proportions proches de 0 ou de 1. Source secondaire (contenu modifiable), à lire après l’article de Brown, Cai et DasGupta ; l’article original de 1927 n’a pas pu être ouvert. »
- proportion_confint (statsmodels, version 0.15.0) · statsmodels. Documentation officielle. Consulté le . À l’appui de : « La bibliothèque statistique statsmodels (version 0.15.0) propose six méthodes de calcul de la fourchette d’une proportion (normale, Agresti-Coull, Clopper-Pearson, Wilson, Jeffreys, test binomial), cite Brown, Cai et DasGupta et ne présente pas Wilson comme supérieure dans l’absolu : la méthode par défaut est la normale. Nommer la méthode la rend reproductible. »
Auteur et journal des modifications#
- Auteur
- L’équipe GeoMetrick
- Relecteur
- Esteban, associé de GeoMetrick
- Publié le
- Dernière mise à jour
- Prochaine revue au plus tard
Journal des modifications
- : Rédaction assistée par un agent à partir des sources citées sur cette page ; tableau de fourchettes calculé (formule de Wilson, aucune mesure) ; distribution de vingt-cinq répétitions à produire.
- : Publication décidée par Esteban (GeoMetrick) après la vérification de chaque affirmation par rapport à sa source (rapport du 02/10/2026) ; les mesures annoncées restent à produire et seront ajoutées à mesure.