L'image de marque mesurée par des modèles de langage
Ce qu'un modèle de langage mesure réellement d'une image de marque, en quoi cela diffère de la réputation et de l'opinion, et ce qui reste interprétable.
À retenir
- Interroger un modèle de langage sur une marque ne mesure pas l'opinion des publics: cela mesure la représentation dominante dans les corpus et les sources que le système mobilise au moment de la réponse.
- Trois propriétés interdisent de lire ces sorties comme un sondage: la variabilité des réponses, la dépendance à la formulation de la question et l'absence de population de référence.
- Restent légitimement mesurables la présence ou l'absence de la marque, les attributs qui lui sont spontanément associés, les sources citées et les erreurs factuelles répétées.
- Trois hypothèses de travail: la réponse générée devient une surface de réputation à part entière, la mesure se déplace vers l'audit de sources, la notion d'image se scinde en image publique et image machine.
Depuis que les réponses générées s'intercalent entre une question et les pages qui y répondaient, les directions de la communication posent une question nouvelle et légitime: que dit un modèle de langage de notre marque, et comment le mesurer? La démarche est saine, la formulation est piégeuse. Elle laisse entendre qu'un modèle constitue un public que l'on sonderait, alors qu'il constitue un reflet, produit par des corpus, des filtres et parfois une recherche en ligne exécutée à l'instant de la réponse.
Cette confusion n'est pas anodine, car elle détermine ce que l'on croit avoir mesuré. Les travaux de qualification publiés par l'Observatoire de l'Intelligence Économique rappellent qu'un indicateur ne vaut que par la définition de ce qu'il compte, et les reportages de Le Fil de la Veille sur les nouveaux tableaux de bord de réputation montrent des équipes qui présentent en comité des réponses de modèles comme des verbatims clients. L'objet de cette analyse est de séparer nettement ce qui se mesure de ce qui ne se mesure pas, avant de poser des hypothèses de travail sur la suite.
Ce qu'un modèle de langage restitue quand on l'interroge sur une marque
Une réponse générée est une reconstitution probable, pas une observation. Elle agrège ce qui, dans les textes ayant servi à l'entraînement, se dit le plus régulièrement d'un objet, puis, dans les systèmes reliés à une recherche, ce que les documents rapatriés au moment de la question contiennent. Le résultat est donc une image consolidée, lissée par la fréquence et par l'ancienneté relative des sources. Une marque très commentée dans la presse spécialisée y apparaît avec les attributs de cette presse, une marque peu documentée y apparaît avec des attributs de sa catégorie plutôt que les siens.
Il faut en tirer une conséquence méthodologique ferme. Ce qu'un modèle restitue n'est pas l'opinion de personnes, ce n'est pas non plus la réalité de l'entreprise: c'est l'état d'un discours écrit, filtré par un système. Cela reste une information utile, parce que ce discours écrit constitue la matière première de ce que liront des clients, des candidats et des journalistes. Mais l'unité de mesure n'est ni le répondant ni le fait, c'est l'énoncé dominant, et aucune extrapolation vers une part d'opinion favorable n'est recevable.
Image de marque, réputation, visibilité générative: trois objets à séparer
L'image de marque désigne la représentation qu'un public se fait d'une marque, telle qu'on peut la décrire par enquête ou par entretien. La réputation en ligne désigne l'état des traces publiques accessibles sur cette marque, sur lesquelles travaille la veille classique. La visibilité générative, notion récente, désigne la présence de la marque dans les réponses produites par des systèmes conversationnels, avec les attributs et les sources qui l'accompagnent. Les trois se recoupent sans se confondre, et une marque peut être bien vue de ses clients tout en étant absente des réponses générées de sa catégorie.
Séparer ces objets sert à trancher qui pilote quoi. La première relève des études, la deuxième de la veille et de la communication, la troisième d'un travail éditorial et documentaire sur les sources que les systèmes reprennent. Confondre les trois produit des plans d'action inadaptés: on lance une campagne d'image pour corriger une absence dans les réponses générées, alors que le problème tient à l'inexistence de documents publics fiables et structurés sur la marque.
Trois propriétés qui interdisent de lire ces réponses comme un sondage
La première propriété est la variabilité. Une même question posée deux fois ne produit pas exactement la même réponse, et l'écart n'exprime aucune évolution de l'opinion: il exprime le fonctionnement du système. Toute mesure sérieuse suppose donc des interrogations répétées, un enregistrement daté de chaque réponse et une lecture en distribution plutôt qu'en valeur unique. La seconde propriété est la dépendance à la formulation: demander quelles sont les meilleures solutions d'un marché, puis demander quelles solutions ont mauvaise réputation, mobilise des voisinages textuels différents et produit des listes difficilement comparables.
La troisième propriété est l'absence de population de référence. Un sondage vaut par son échantillon et par la possibilité de le redresser; une réponse générée n'a ni échantillon ni univers, seulement un corpus dont la composition n'est pas publiée. Il n'existe donc pas de marge d'erreur à afficher, et présenter un pourcentage de réponses favorables sans dire combien d'interrogations ont été faites, avec quelles formulations et à quelles dates, revient à produire un chiffre sans définition. La rigueur consiste ici à documenter le protocole plus que le résultat.
Ce qui reste légitimement mesurable
Quatre indicateurs résistent à cet examen. La présence ou l'absence: la marque est-elle citée quand on décrit sa catégorie, et à quel rang apparaît-elle dans une énumération. Les attributs associés: quels qualificatifs reviennent, et lesquels appartiennent à la marque plutôt qu'à son secteur. Les sources citées: quels sites, publications et documents le système mobilise, ce qui indique où porter l'effort éditorial. Les erreurs répétées: une confusion de filiale, un dirigeant périmé, un incident ancien présenté comme actuel, autant de défauts corrigibles par la publication de documents clairs.
Ces quatre indicateurs ont une vertu commune: ils portent sur des faits observables dans la sortie du système, et non sur une inférence à propos d'êtres humains. Ils se prêtent à un suivi dans le temps à condition de figer le protocole, la liste des questions, leur ordre, la fréquence de passage et le mode d'enregistrement. C'est exactement la discipline d'une série statistique de veille: la valeur ne vient pas d'une mesure isolée mais de la stabilité du dispositif qui la produit.
Un modèle de langage ne dit pas ce que le public pense d'une marque, il dit ce que les textes disponibles ont fini par en dire.
Prospective: trois hypothèses de travail
Première hypothèse: la réponse générée devient une surface de réputation à part entière, gérée comme on gère aujourd'hui une page de résultats. Dans ce cas apparaissent des fonctions dédiées, des indicateurs contractualisés avec les agences et des procédures de correction en cas d'erreur factuelle. Le signal qui confirmerait cette hypothèse est l'entrée d'indicateurs de présence dans les réponses générées au sein des tableaux de bord trimestriels des directions de la communication.
Deuxième hypothèse: la mesure se déplace de la sortie vers les sources. Puisque la sortie varie et que sa fabrique reste opaque, l'effort utile porte sur l'audit du corpus public: fiches d'entreprise, documents réglementaires, pages de référence, publications sectorielles, articles de presse. Le signal serait la généralisation d'audits de sources, où l'on vérifie l'exactitude et la disponibilité des documents plutôt que l'on interroge les systèmes.
Troisième hypothèse: la notion d'image de marque se scinde durablement en deux, une image publique mesurée par enquête et une image machine mesurée par protocole d'interrogation, avec des écarts assumés entre les deux. Le signal serait l'apparition, dans les rapports annuels et les revues de marque, de deux séries d'indicateurs présentées côte à côte sans être additionnées. Cette hypothèse a l'avantage de la clarté conceptuelle et l'inconvénient d'ajouter une mesure à piloter.
Conséquences pour les directions communication et veille
La première conséquence est un partage de responsabilités. La correction d'une erreur factuelle répétée par un système ne relève pas de la campagne, elle relève de la production documentaire: publier une page de référence datée, cohérente et facile à recouper vaut mieux qu'un communiqué. La deuxième est une exigence de traçabilité: chaque réponse enregistrée doit conserver la date, la formulation exacte de la question et les sources citées, faute de quoi la série devient inexploitable dès la première contestation en comité.
La troisième conséquence porte sur l'articulation avec la veille existante. Une anomalie détectée dans une réponse générée trouve presque toujours son origine dans une publication réelle, souvent ancienne, qu'il faut retrouver et qualifier. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie les publications par pertinence et relie chaque signal à sa source d'origine, ce qui ramène l'anomalie observée au document qui l'a produite. Le jugement sur la réponse à donner, lui, appartient à l'organisation et se décide avec la direction juridique autant qu'avec la communication.
Questions fréquentes
Peut-on mesurer une image de marque avec un modèle de langage?
On mesure une représentation textuelle, pas une perception humaine. Un modèle restitue ce que les corpus disponibles disent le plus régulièrement d'une marque, filtré par le système et, selon les cas, complété par des documents rapatriés au moment de la question. C'est une information exploitable sur l'état du discours écrit, à condition de ne jamais la présenter comme un résultat d'enquête ni d'en tirer une part d'opinion favorable.
Qu'est-ce que la visibilité générative d'une marque?
C'est la présence d'une marque dans les réponses produites par des systèmes conversationnels lorsqu'on interroge sa catégorie, accompagnée des attributs qui lui sont associés et des sources citées. Elle se mesure par un protocole d'interrogation répété et documenté, et elle se travaille surtout en amont, par la qualité, la fraîcheur et la structuration des documents publics disponibles sur la marque.
Comment corriger une information fausse répétée par un système génératif?
La première étape consiste à remonter à la source: une erreur récurrente vient presque toujours d'un document existant, article ancien, fiche non mise à jour, base incorrecte. La deuxième consiste à corriger ou faire corriger ce document, puis à publier une référence claire et datée qui expose le fait exact. La troisième consiste à réinterroger selon le même protocole à intervalles réguliers, pour constater si la correction se propage, ce qui prend du temps et n'est jamais garanti.