Pourquoi les réponses des IA changent à chaque fois
La même question, posée deux fois, donne deux réponses différentes. Ce n'est ni une panne ni la preuve que votre contenu fonctionne : c'est de l'échantillonnage.
Demandez à ChatGPT quels outils dominent votre catégorie. Notez les noms. Fermez la fenêtre, ouvrez-en une nouvelle, posez la même question. Il y a de fortes chances que la liste ne soit pas la même : une marque qui était présente a disparu, une autre que vous n'aviez jamais entendue est apparue. Rien n'a changé dans le monde entre les deux questions, ni sur votre site.
Face à cela, on réagit presque toujours de deux façons erronées : soit l'outil qui le signale est défaillant, soit quelque chose publié la semaine dernière a enfin commencé à fonctionner. Les deux lectures transforment du bruit en décisions, l'erreur la plus coûteuse dans ce domaine.
La volatilité des réponses n'est pas un défaut à signaler au support technique. C'est une propriété de la façon dont ces systèmes produisent du texte. Une fois que l'on sait d'où elle vient, on arrête d'essayer de l'éliminer et on commence à mesurer autour d'elle.
Cinq raisons du changement
Le modèle échantillonne, il ne consulte rien
Un modèle de langage ne va pas chercher une réponse stockée pour vous la remettre. Il l'écrit un fragment à la fois, en calculant à chaque étape une distribution de probabilité sur ce qui pourrait venir ensuite, puis il choisit. Pas toujours le candidat le mieux classé : les paramètres d'échantillonnage, dont la température et le top-p, laissent passer des choix moins bien classés. C'est ce qui fait que le texte se lit comme une prose et non comme un enregistrement figé.
La conséquence est structurelle. Si votre marque se trouve près de la limite de ce que le modèle juge plausible, elle est citée sur certaines exécutions et ignorée sur d'autres, à partir d'une invite identique, sans que rien n'ait changé. Les marques bien installées dans le territoire de confiance du modèle sortent presque toujours, celles qui en sont loin, presque jamais. Ce sont les cas limites qui vacillent.
La couche d'instructions cachées est réécrite
Chaque assistant grand public enveloppe votre question dans des instructions que vous ne voyez jamais. Cette couche indique au modèle comment se comporter, à quel point rester prudent, s'il doit citer des produits commerciaux, quand chercher sur le web avant de répondre. Les éditeurs la modifient régulièrement, sans journal des changements. Un durcissement discret de la règle sur les marques recommandables peut rebattre toute une catégorie, sans nouveau modèle, sans annonce.
Le modèle derrière le nom du produit est remplacé
L'assistant garde son nom. Les poids qui sont derrière, non. Une nouvelle version sort, une ancienne est retirée, une variante moins coûteuse sert une partie du trafic. Ce que le système sait, et la façon dont il le formule, change. Vos questions sont identiques ; celui qui les lit maintenant est différent.
La recherche de sources capte un web différent à chaque fois
Quand un assistant fait une recherche avant de répondre, il va chercher des pages en direct, et le web en direct n'est pas un objet stable. Les résultats se réordonnent, une page est modifiée, un article comparatif est publié et indexé. Les documents que le modèle lit en répondant ne sont pas ceux d'hier, donc la réponse construite à partir d'eux n'est pas celle d'hier. Sur les plateformes qui s'appuient fortement sur la recherche de sources, c'est la plus grande source de mouvement : votre visibilité peut bouger à cause d'une décision éditoriale prise par une publication que vous n'avez jamais consultée.
Votre propre session n'est pas un instrument neutre
La mémoire, les préférences enregistrées, les instructions personnalisées et la conversation déjà présente conditionnent toutes ce qui vient ensuite. Posez une question sur un concurrent, puis demandez qui d'autre existe : vous obtenez autre chose qu'avec une question à froid dans une session vierge. Vérifiez votre marque depuis le compte que vous utilisez depuis un an pour en parler, et vous ne voyez pas ce que voit un inconnu : vous voyez votre reflet.
Ce que cela change pour la mesure
En assemblant ces cinq points, la conclusion est simple : une réponse unique est une anecdote, pas une donnée. C'est un tirage dans une distribution, qui ne porte presque aucune information. La rapporter revient à présenter un seul jet de pièce comme une preuve sur la pièce elle-même.
C'est là que le reporting interne s'effondre en silence. Quelqu'un vérifie un mardi, voit la marque citée, et annonce à l'équipe que le contenu porte ses fruits. Quelqu'un d'autre vérifie la semaine suivante, ne voit rien, et l'équipe conclut que la visibilité s'est effondrée. La distribution n'a pas bougé : elle a été échantillonnée deux fois, et les deux échantillons sont en désaccord, ce qui est précisément ce que font des échantillons.
Ce qui porte de l'information, c'est la répétition associée à une direction. Exécutez la même invite de nombreuses fois et vous obtenez un taux : à quelle fréquence la marque apparaît. Comparez-le au taux d'il y a un mois, sur les mêmes invites et dans la même langue, et vous obtenez le seul résultat qui mérite d'être montré : une courbe de tendance.
Comment séparer le bruit du mouvement réel
Cela ne demande aucune sophistication statistique, juste de la discipline sur ce que l'on garde fixe.
- Figez l'ensemble des invites. Réécrivez les questions entre deux relevés et vous aurez changé l'instrument autant que la mesure. Une meilleure formulation devient une nouvelle invite, sans remplacer l'ancienne.
- Figez la langue. La même question en français et en espagnol n'est pas la même question, car les modèles puisent dans des corpus différents. Ne comparez jamais entre langues en appelant cela une tendance.
- Exécutez chaque invite plus d'une fois. Un résultat construit sur une seule exécution est un jet de pièce avec un graphique autour. Plusieurs exécutions, agrégées, transforment une anecdote en un taux.
- Lisez la direction sur plusieurs relevés, jamais l'écart entre deux. La différence entre deux échantillons bruités est surtout du bruit. Plusieurs relevés dessinent une forme, et c'est cette forme qui est le signal.
- Gardez les concurrents comme témoin. Si votre taux baisse et que celui de tout le monde baisse aussi sur cette plateforme, c'est elle qui a changé, pas votre entreprise.
Ce qu'une cadence d'échantillonnage donne honnêtement
Ici, il faut être francs sur notre propre produit, car le secteur ne l'est généralement pas. PSentry exécute votre ensemble figé d'invites sur ChatGPT, Claude, Gemini et Perplexity, dans chaque langue où vous vendez, et enregistre où vous avez été cité, mentionné comme source, et qui a été recommandé à votre place. Les analyses tournent selon un calendrier, deux fois par mois : une cadence d'échantillonnage, pas une surveillance. Elle indique si la tendance bouge et dans quelle direction, pas qu'un éditeur vient de réécrire sa couche d'instructions. Si un concurrent bondit un jeudi, vous l'apprenez à l'analyse suivante, pas ce soir-là. Nous ne vendons pas d'alertes instantanées : une alerte sur un seul relevé bruité n'est qu'une notification sur rien, déguisée en urgence.
Faux triomphe et fausse alerte
Faux triomphe : vous publiez une page comparative, posez la question cet après-midi-là, voyez votre nom, et concluez que la page a fonctionné. Ou bien c'était simplement l'exécution où l'échantillonnage a joué en votre faveur. Le test honnête : le taux d'apparition doit être plus élevé sur les prochains relevés que sur les précédents. Cela prend des semaines, et c'est la seule version qui résiste à la question de savoir comment.
Fausse alerte : votre marque a disparu d'une réponse et une réunion a été programmée. Avant, posez-vous trois questions : l'invite était-elle identique, la langue était-elle identique, était-ce une seule exécution. Si l'une des réponses est oui, rien à discuter encore : mieux vaut attendre le prochain relevé que réécrire le site sur une seule phrase.
La discipline qu'exige ce domaine consiste à cesser de lire les réponses comme des verdicts : ce sont des échantillons, et seule la forme qu'ils dessinent dans le temps a un sens.
Questions Fréquentes
Si la réponse change à chaque fois, est-il inutile de la mesurer ?
Non, mais la mesurer une seule fois l'est. La volatilité ne rend pas un système immesurable, elle le rend immesurable en une seule observation. La météo aussi est volatile et pourtant parfaitement mesurable. Ce que vous estimez, c'est un taux d'apparition, qui a besoin de nombreuses observations avant de se stabiliser.
Combien d'exécutions d'une invite suffisent ?
Il n'existe pas de seuil précis, et quiconque en cite un avec assurance devine. La règle pratique : il faut assez d'exécutions pour qu'en ajouter davantage cesse de changer le tableau. En attendant, traitez les invites où vous n'apparaissez que par moments comme réellement à la limite.
Puis-je supprimer le hasard en réglant la température sur zéro ?
Pas dans les assistants que vos acheteurs utilisent réellement, qui n'exposent aucun réglage de ce type. Même via une API, des réglages bas réduisent la variation sans garantir un résultat identique, et n'agissent en rien sur les autres sources : modèle mis à jour, instructions réécrites, pages récupérées différentes.
La volatilité touche-t-elle les quatre plateformes de la même façon ?
Non. Les plateformes qui recherchent des pages en direct héritent aussi de l'instabilité du web, elles bougent donc davantage. Les réponses tirées de ce qu'un modèle a absorbé pendant l'entraînement changent par paliers lors d'une mise à jour, plutôt que de dériver en continu.
Une marque mentionnée de façon inconstante est-elle mieux lotie qu'une marque jamais mentionnée ?
Oui. Des mentions inconstantes signifient que le modèle vous considère comme plausible sans en être pleinement sûr, une position différente d'être hors de l'ensemble des candidats. Ce sont ces invites vacillantes où un changement apparaît en premier.