mercredi 7 octobre 2026
Repères

Web intelligence : ce que le terme désigne, et ce qu'il ne désigne pas

Le terme web intelligence recouvre trois emplois distincts. Nous les séparons, puis nous le délimitons face au web analytics, à la business intelligence et à l'OSINT.

La rédaction1 septembre 20268 min de lecture

À retenir

  • Web intelligence désigne tour à tour une ingénierie de collecte sur le web, une catégorie d'outils du marché et une pratique analytique sur sources ouvertes.
  • La ligne de partage avec le web analytics et la business intelligence tient à la propriété des données : données de tiers dans un cas, données propres à l'organisation dans l'autre.
  • Face à l'OSINT, la différence n'est pas de méthode mais de périmètre : le web n'est qu'une partie des sources ouvertes disponibles.
  • Le mot choisi engage un régime juridique : accessible publiquement ne signifie pas librement réutilisable.

Web intelligence est l'une de ces expressions que chacun emploie sans jamais la définir, parce que son sens paraît évident : de l'intelligence tirée du web. L'évidence disparaît dès qu'on met deux interlocuteurs face à face. Pour un ingénieur de données, le terme désigne une chaîne technique de collecte à grande échelle. Pour un acheteur de logiciel, il désigne une catégorie du marché. Pour un analyste, il désigne une pratique d'exploitation de sources ouvertes. Les trois emplois coexistent dans les mêmes documents et se contredisent parfois.

Cette ambiguïté n'est pas anodine, parce que le mot sert à écrire des cahiers des charges, à cadrer des budgets et à répartir des responsabilités entre une direction des systèmes d'information et une fonction d'intelligence économique. Un projet dit de web intelligence peut aboutir à un entrepôt de données web ou à une cellule d'analyse, deux résultats sans rapport, pour un même intitulé et un même montant.

Nous délimitons donc les trois emplois du terme, puis nous le confrontons aux notions voisines dont il est régulièrement le synonyme abusif : web analytics, business intelligence, OSINT, web mining. Les critères de bascule et les conséquences pratiques viennent ensuite.

Trois emplois du terme web intelligence, et ce qu'ils ont en commun

Le premier emploi est technique. La web intelligence y désigne l'ingénierie qui rend le web exploitable comme source de données : exploration systématique de sites, extraction structurée, normalisation, détection de changements, gestion des blocages et des limitations de débit, stockage historisé. Le livrable est un jeu de données daté et réinterrogeable, pas une analyse. C'est l'acception dominante dans les équipes de données, et celle qui absorbe l'essentiel du coût d'un projet.

Le deuxième emploi est commercial. La web intelligence nomme un rayon du marché logiciel, entre les agrégateurs de presse, les plateformes d'écoute des réseaux sociaux et les moteurs de recherche sur sources ouvertes. Le terme y sert à positionner une offre plutôt qu'à décrire une fonction, ce qui explique qu'il recouvre des périmètres très inégaux d'un fournisseur à l'autre.

Le troisième emploi est analytique. La web intelligence désigne alors le travail d'exploitation de ce qui est publiquement accessible en ligne pour éclairer une décision : qualification de signaux, recoupement de sources, cartographie d'acteurs, suivi d'une exposition. Ce que les trois emplois partagent est mince mais réel : une matière de tiers, publiée en ligne, collectée sans coopération de son émetteur.

Ce que la web intelligence n'est pas : web analytics et business intelligence

Le web analytics mesure ce qui se passe sur les propriétés numériques de l'organisation elle-même : audience d'un site, parcours, conversions, provenance du trafic. Les données y sont produites par l'organisation et lui appartiennent, la collecte est consentie par instrumentation, et la question posée est descriptive : que s'est-il passé chez moi. La web intelligence porte au contraire sur des données émises par des tiers, dont l'organisation n'a pas la maîtrise et qu'elle doit aller chercher.

La business intelligence, de son côté, exploite des données internes déjà structurées, issues des systèmes de gestion, pour produire des indicateurs de pilotage. Sa difficulté est la modélisation, pas l'accès. Celle de la web intelligence est exactement inverse : l'accès et la qualification dominent, la structuration arrive après, sur une matière hétérogène, multilingue et instable. Confondre les deux conduit à sous-estimer d'un ordre de grandeur l'effort d'acquisition d'un projet web.

Web intelligence et OSINT : le périmètre de sources contre la nature de la collecte

L'OSINT désigne le renseignement obtenu à partir de sources ouvertes, quel qu'en soit le support : presse, registres administratifs, publications scientifiques, imagerie satellitaire commerciale, documents officiels, bases de brevets, données de transport, et bien sûr le web. La web intelligence n'est donc pas une alternative à l'OSINT, elle en est un sous-ensemble défini par le canal. Tout ce qui relève de la web intelligence relève de l'OSINT, l'inverse est faux.

La distinction a des effets concrets sur la qualité d'un dossier. Une pratique restreinte au web hérite des biais du web : surreprésentation des sources qui publient en ligne et en anglais, effacement des archives, dépendance à l'indexation. Les travaux publiés par l'Observatoire de l'Intelligence Économique rappellent que les sources primaires les plus décisives, actes administratifs et documents déposés, arrivent souvent en ligne avec un délai qui n'a rien à voir avec la cadence des flux d'actualité.

Un second écart concerne la finalité. L'OSINT s'inscrit dans un cycle de renseignement, avec un besoin exprimé, une orientation, une exploitation et une diffusion contrôlée. La web intelligence, dans son emploi technique, s'arrête à la mise à disposition d'une matière. Un dispositif qui livre des jeux de données web sans cycle de qualification produit du volume, pas du renseignement.

L'héritage du web mining : contenu, structure et usage

Le terme vient d'une littérature académique qui distinguait trois objets de fouille du web : le contenu des pages, la structure des liens entre elles, et les traces d'usage laissées par les visiteurs. Cette tripartition reste le meilleur outil de clarification disponible, parce qu'elle sépare des matières dont l'accès, la légalité et l'interprétation diffèrent radicalement.

La fouille de contenu alimente la veille au sens courant. La fouille de structure alimente la cartographie : qui cite qui, quels sites relaient quels autres, comment un récit circule. La fouille d'usage, elle, suppose l'accès à des traces comportementales, qui ne sont presque jamais publiques et dont la collecte relève d'un régime de données personnelles. Une offre qui promet les trois sur des sources tierces mérite une lecture attentive de son mode d'acquisition.

Les critères qui font basculer d'une notion à l'autre

Trois questions suffisent à trancher un cas ambigu. À qui appartiennent les données, sur quel canal ont-elles été obtenues, et le livrable attendu est-il une matière ou une conclusion. Si les données sont celles de l'organisation, le sujet est le web analytics ou la business intelligence. Si elles viennent de tiers et que le livrable est une matière réinterrogeable, le terme web intelligence est justifié. Si le livrable est une conclusion cadrée par un besoin, on est dans un cycle de renseignement sur sources ouvertes.

Publiquement accessible ne veut pas dire librement réutilisable : c'est la phrase que l'on aimerait voir figurer en tête de tout cahier des charges de web intelligence.

Ce que le choix du mot engage juridiquement et organisationnellement

Le premier engagement est juridique. Une donnée en accès libre reste soumise au droit d'auteur, aux conditions d'utilisation du site, à la protection des bases de données et, dès qu'elle concerne une personne identifiable, au régime des données personnelles. Un projet qualifié de web intelligence embarque donc une conformité que le web analytics ne connaît pas, puisqu'il porte sur des données de tiers collectées sans leur coopération. Les cas rapportés par Le Fil de la Veille montrent que cette conformité se traite au moment du cadrage, pas après la mise en production.

Le deuxième engagement est organisationnel : il désigne qui porte le projet. Une web intelligence entendue au sens technique relève d'une équipe de données, avec des compétences d'ingénierie et un budget d'infrastructure. Entendue au sens analytique, elle relève d'une fonction d'intelligence économique, avec des compétences de qualification et une chaîne de garde documentaire. Sur la partie collecte, NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie les signaux par intention et renvoie chaque résultat vers sa source primaire. Le reste, la définition du besoin et l'arbitrage final, reste le travail de l'organisation.

Questions fréquentes

Quelle est la différence entre web intelligence et OSINT ?

La différence porte sur le périmètre des sources, pas sur la méthode. L'OSINT exploite toutes les sources ouvertes, y compris des registres administratifs, des publications scientifiques ou de l'imagerie commerciale qui n'ont pas de version web exploitable. La web intelligence se limite à ce qui est accessible en ligne. Une pratique qui s'arrête au web hérite donc des biais du web, notamment l'absence des documents qui n'y sont jamais publiés.

La web intelligence est-elle la même chose que le web scraping ?

Non. Le scraping est une technique d'extraction, l'un des moyens d'acquisition possibles. La web intelligence, dans son emploi technique, désigne l'ensemble de la chaîne : identification des sources, acquisition par interface programmatique, par flux ou par extraction, normalisation, historisation, détection de changements. Réduire l'une à l'autre conduit à négliger l'historisation, qui est pourtant ce qui donne sa valeur au dispositif dans le temps.

Faut-il parler de web intelligence ou de veille dans un cahier des charges ?

Cela dépend du livrable attendu. Si l'on attend un jeu de données réinterrogeable, web intelligence décrit correctement l'objet. Si l'on attend des notes qualifiées adressées à des destinataires nommés, le mot veille est plus juste, et le cahier des charges doit alors préciser la cadence de diffusion et les critères de qualification, qui sont hors du périmètre d'une chaîne technique.

Le web analytics peut-il alimenter une démarche de web intelligence ?

Oui, en aval et à titre de contrôle. Les données d'audience propres à l'organisation servent à mesurer l'effet d'un phénomène détecté à l'extérieur, par exemple une variation de requêtes de marque après une publication tierce. Mais elles ne détectent rien par elles-mêmes, puisqu'elles ne voient que ce qui arrive déjà sur les propriétés de l'organisation. La détection suppose des sources externes.

Pour approfondir