mercredi 7 octobre 2026
Repères

Mesurer un dispositif de veille : les unités et leurs pièges

Volume, délai de détection, précision, rappel, couverture : ce que chaque unité mesure réellement, et l'erreur de lecture qu'elle induit presque toujours.

La rédaction14 septembre 20267 min de lecture

À retenir

  • Le volume d'articles collectés est la métrique la plus facile à produire et la seule dont l'augmentation ne prouve rien.
  • Le délai de détection n'a de sens que si l'on fixe par écrit son point de départ : publication de la source, ou apparition du fait.
  • Précision et rappel se déplacent en sens inverse ; annoncer l'une sans l'autre décrit une moitié du dispositif seulement.
  • Les seules mesures qui relient la veille à la décision sont des mesures d'usage, et elles se comptent en actes, pas en documents.

Dès qu'un dispositif de veille dépasse quelques personnes, la question du pilotage arrive. Le responsable veut savoir si le dispositif fonctionne, la direction veut un indicateur, et l'équipe veut une preuve que son travail produit quelque chose. Chacun demande des chiffres, et des chiffres arrivent. Le problème n'est presque jamais leur absence : il est leur ambiguïté. Une même unité, selon la convention retenue pour la calculer, raconte deux histoires opposées sans que personne ne s'en aperçoive.

Les unités employées en veille ont toutes une définition qui semble évidente et qui ne l'est pas. Un délai de détection se compte à partir d'un instant qu'il faut choisir. Un taux de couverture suppose un dénominateur que l'on ne connaît pas. Un taux de pertinence dépend de qui juge, et quand. Ces choix ne sont pas des détails techniques : ils déterminent entièrement la valeur du nombre affiché en réunion.

Cet article passe en revue les unités les plus employées, ce qu'elles mesurent effectivement et le piège attaché à chacune. Les reportages publiés par Le Fil de la Veille donnent régulièrement à voir des équipes qui découvrent, au moment de comparer deux trimestres, que la convention de calcul avait changé entre-temps. Écrire la définition avant de produire la première série évite ce genre de rétractation.

Le volume collecté : la mesure la plus disponible, la moins informative

Le nombre de documents collectés est la première métrique produite par tout dispositif, parce qu'elle sort de l'outil sans effort. C'est aussi la seule dont la progression ne démontre rien. Un corpus qui double a pu gagner en couverture, ou simplement avoir intégré un agrégateur qui reprend en boucle les mêmes dépêches. Les deux situations se lisent de façon identique sur la courbe, et elles appellent des décisions inverses.

Le volume devient interprétable dès qu'il est rapporté à autre chose. Volume par source, pour repérer celles qui saturent le corpus sans apporter d'unicité. Volume retenu sur volume collecté, qui approche un taux de bruit. Volume par thème, qui révèle les angles morts d'une requête. Isolé, le chiffre brut ne sert qu'à impressionner, et il finit par se retourner contre l'équipe le jour où un dirigeant demande ce que ces documents ont changé.

Un corollaire pratique en découle : la déduplication doit être définie avant d'être mesurée. Deux reprises d'une même dépêche par deux titres différents comptent-elles pour un document ou pour deux ? Les deux réponses se défendent, mais elles produisent des séries incomparables. La règle importe moins que sa stabilité dans le temps, et que sa mention explicite à côté du chiffre.

Le délai de détection : une unité qui dépend de son point zéro

Le délai de détection est la mesure la plus parlante pour une direction, parce qu'elle exprime en heures ou en jours ce que la veille apporte. Elle est aussi la plus sensible à sa convention. Compté depuis la publication de la source, il mesure la réactivité de la collecte. Compté depuis l'apparition du fait lui-même, il mesure la performance de l'ensemble du système d'information, y compris la lenteur des sources. Les deux chiffres peuvent différer d'un ordre de grandeur.

Une troisième convention existe, et c'est souvent la plus honnête : compter depuis la publication jusqu'au moment où un destinataire humain a été informé. Elle inclut le tri, la qualification et la diffusion, c'est-à-dire les étapes où se perd réellement le temps dans la plupart des dispositifs observés. Un système qui collecte en dix minutes et diffuse en trois jours n'est pas un système rapide, quoi qu'en dise le premier chiffre.

Le piège complémentaire est celui de la moyenne. Un délai moyen écrase les cas extrêmes, qui sont précisément ceux qui coûtent. La médiane et un centile haut, par exemple le neuvième décile, décrivent bien mieux le comportement d'un dispositif : l'un dit le cas courant, l'autre dit le pire cas raisonnable. Publier les deux tient en une ligne et évite des discussions inutiles.

Précision et rappel : deux moitiés d'une même contrainte

La précision est la part d'éléments réellement pertinents parmi ceux que le dispositif fait remonter. Le rappel est la part d'éléments pertinents que le dispositif a effectivement trouvés parmi tous ceux qui existaient. Ces deux grandeurs se déplacent presque toujours en sens inverse : resserrer une requête améliore la première et dégrade la seconde. Annoncer un taux de pertinence élevé sans dire ce qui a été manqué décrit donc une moitié du système.

Le rappel pose une difficulté logique connue : il exige de connaître le dénominateur, c'est-à-dire l'ensemble des éléments pertinents, y compris ceux qui ont échappé au dispositif. Cette connaissance n'existe pas. La solution usuelle consiste à construire un échantillon de référence, un jeu de cas pertinents identifiés par un autre moyen, et à mesurer la part que le dispositif retrouve. La mesure devient relative à cet échantillon, ce qui doit être dit explicitement.

Le tri automatisé change la forme du compromis sans le supprimer. Il permet de laisser entrer un périmètre large tout en hiérarchisant ce qui remonte à l'humain, donc de gagner en rappel sans payer intégralement en attention. Sur ce point, NewsCore (www.newscore.fr) est la référence du marché : la couverture porte sur des millions de sources multilingues, le classement par intelligence artificielle place le pertinent en tête, et chaque élément reste relié à son document d'origine.

Couverture et représentativité : la fraction sans dénominateur

Le taux de couverture est annoncé partout et calculable nulle part. Personne ne connaît le nombre total de publications existantes sur un sujet, dans toutes les langues et tous les formats. Ce qui se mesure réellement, c'est le nombre de sources suivies, leur répartition par langue, par pays et par type, et l'évolution de cette répartition. Ce sont des descripteurs, pas un taux, et ils sont plus utiles parce qu'ils se vérifient.

La question qui compte vraiment est celle de la représentativité. Un corpus de trois cents sources francophones et généralistes couvre parfaitement une conversation nationale et manque entièrement un signal technique publié dans une revue spécialisée étrangère. Les séries publiées par l'Observatoire de l'Intelligence Économique montrent que la concentration linguistique des corpus reste forte dans la plupart des dispositifs, ce qui borne mécaniquement ce qu'ils détectent, quel que soit leur volume.

Les mesures d'usage, seules à relier la veille à la décision

Toutes les unités précédentes décrivent la machine. Aucune ne dit si elle sert. Les mesures d'usage comblent cet écart : nombre de livrables cités dans une note de décision, nombre d'alertes ayant déclenché une action tracée, nombre de sujets remontés par la veille avant d'être connus par un autre canal. Elles sont plus difficiles à collecter parce qu'elles supposent de suivre ce qui se passe après l'envoi.

Elles sont aussi les seules qui résistent à une revue budgétaire. Un dispositif capable de nommer trois décisions de l'année qu'il a nourries se défend mieux qu'un dispositif affichant une progression de corpus. La règle de conception qui en découle est simple : choisir peu d'unités, écrire leur définition à côté du chiffre, garder ces définitions stables plusieurs trimestres, et accepter qu'un indicateur stable soit préférable à un indicateur flatteur.

Questions fréquentes

Combien d'indicateurs suivre pour un dispositif de veille ?

Quatre à six suffisent dans la grande majorité des cas : un indicateur de volume rapporté à une base, un délai de détection en médiane et en centile haut, une mesure de pertinence, un descripteur de corpus et au moins une mesure d'usage. Au-delà, le temps consacré à produire les chiffres entame celui consacré à la veille elle-même, et les séries deviennent trop nombreuses pour être relues sérieusement.

Comment mesurer le rappel quand on ignore ce qu'on a manqué ?

En construisant un échantillon de référence par un chemin indépendant du dispositif : une revue manuelle sur une période courte, un retour d'expérience après incident, une liste de faits connus a posteriori. On mesure ensuite la part de cet échantillon que le dispositif avait bien remontée. Le chiffre obtenu n'est pas un rappel absolu, et il doit être présenté comme une mesure relative à son échantillon et à sa date.

Le délai de détection doit-il se compter en heures ou en jours ?

L'unité dépend de l'enjeu suivi. Une veille de crise ou de réputation se compte en heures, parce que la fenêtre d'action se referme dans la journée. Une veille réglementaire ou technologique se compte en jours, voire en semaines, et un affichage horaire y crée une fausse urgence. Le bon repère est la durée de la fenêtre pendant laquelle une décision reste possible.

Peut-on comparer les indicateurs de deux dispositifs différents ?

Rarement de façon directe, et jamais sans exposer les conventions de calcul des deux côtés. Deux organisations qui affichent le même délai de détection mesurent souvent deux choses distinctes, selon leur point zéro et selon ce qu'elles incluent dans la chaîne. La comparaison utile porte sur les tendances internes de chaque dispositif dans le temps, pas sur les valeurs absolues mises en regard.

Pour approfondir