Web intelligence : trois scénarios si le web ouvert se referme
La web intelligence repose sur un web librement collectable. Trois scénarios si cette condition disparaît : accès contractuel, traces indirectes, ouverture imposée par la règle.
À retenir
- La web intelligence n'est pas une technique de collecte mais une hypothèse sur le web : accessible, indexable et représentatif de l'activité réelle.
- Trois scénarios se distinguent : l'accès contractuel et payant, le repli sur les traces indirectes, le maintien d'une ouverture par obligation réglementaire.
- Chaque scénario déplace le coût ailleurs : budget d'accès, incertitude d'inférence, ou dépendance à des données publiées sous contrainte.
- Trois décisions restent valables dans les trois cas : archiver, documenter la provenance, écrire ce que le dispositif ne couvre pas.
La web intelligence désigne l'exploitation systématique de la donnée disponible sur le web ouvert pour décrire des acteurs économiques : offres publiées, prix affichés, effectifs annoncés, technologies employées, implantations, recrutements. Sa force tient à un présupposé rarement énoncé : que le web reste largement accessible, indexable et suffisamment représentatif de l'activité réelle des organisations observées.
Ce présupposé s'affaiblit. Les interfaces publiques se ferment ou deviennent payantes, l'authentification se généralise, les protections anti-collecte se durcissent, et une part croissante de l'activité se déroule dans des espaces qui ne produisent aucune trace publique. Rien n'indique que cette évolution soit uniforme ou irréversible, mais elle justifie d'instruire l'hypothèse d'un web nettement moins collectable.
Trois scénarios servent ici d'hypothèses de travail, sans prétendre à la prédiction. Le Fil de la Veille documente les fermetures d'interfaces à mesure qu'elles se produisent, l'Observatoire de l'Intelligence Économique mesure la part des signaux issus de plateformes propriétaires ; cette analyse en tire les conséquences doctrinales pour les dispositifs qui reposent aujourd'hui sur la collecte ouverte.
Ce que la web intelligence présuppose du web qu'elle observe
Le premier présupposé est l'accessibilité : la page existe, elle se charge sans identification, et sa consultation répétée reste tolérée. Le second est la stabilité : l'adresse persiste et la structure de la page ne change pas assez vite pour rendre l'extraction ingérable. Le troisième, le plus fort, est la représentativité : ce qui est publié refléterait l'activité réelle de l'organisation observée.
Ce troisième présupposé est le plus fragile et le moins discuté. Une entreprise publie ce qu'elle a intérêt à publier. Les offres d'emploi en ligne décrivent le recrutement rendu public, pas le recrutement total. Les prix affichés décrivent la vitrine, pas la transaction négociée. Une web intelligence rigoureuse énonce donc ce que son corpus mesure, et pas seulement ce qu'il suggère.
La fermeture du web n'attaque pas les trois présupposés au même endroit. Elle attaque frontalement l'accessibilité, dégrade la stabilité, et paradoxalement peut renforcer le biais de représentativité : les acteurs qui continuent de publier largement deviennent surreprésentés dans le corpus, et le silence des autres se lit à tort comme une absence d'activité.
Ce qui se referme, concrètement
Quatre mouvements distincts se confondent souvent sous le terme de fermeture. Le premier est la fermeture technique : détection automatisée des collectes, limitation de débit, exigence d'exécution de scripts. Le second est la fermeture contractuelle : conditions d'utilisation qui interdisent l'extraction, indépendamment de la faisabilité technique de celle-ci.
Le troisième mouvement est la fermeture économique. L'accès reste possible, mais il devient facturé, et son coût croît avec le volume et la fraîcheur demandée. Le quatrième est la fermeture par déplacement : l'activité migre vers des espaces qui ne produisent pas de page publique, messageries, groupes fermés, applications, si bien qu'il n'y a plus rien à collecter, même sans obstacle.
Distinguer ces quatre mouvements n'est pas un exercice de vocabulaire. Chacun appelle une réponse différente : ingénierie pour le premier, cadre juridique et contractuel pour le deuxième, budget et arbitrage de périmètre pour le troisième, changement de méthode pour le quatrième. Un dispositif qui traite les quatre comme un seul problème technique se trompe trois fois sur quatre.
Scénario un : l'accès devient contractuel et payant
Dans le premier scénario, la donnée du web reste disponible mais s'achète. Les grandes sources vendent un accès encadré, les intermédiaires revendent des corpus prêts à l'emploi, et la web intelligence devient une fonction d'achat autant qu'une fonction d'analyse. Le savoir-faire rare se déplace de l'extraction vers la négociation et le contrôle de qualité de ce qui est livré.
Ce scénario a un effet de sélection immédiat. Les organisations capables de payer conservent une couverture large ; les autres se replient sur des périmètres étroits. Il produit aussi une dépendance nouvelle : le fournisseur décide de la définition des champs, du calendrier de rafraîchissement et des sources incluses, et le veilleur perd la maîtrise de son propre échantillon.
La conséquence méthodologique est nette. Dans ce scénario, la traçabilité devient contractuelle avant d'être technique : il faut exiger la provenance de chaque enregistrement, la date de collecte et la règle d'inclusion. Un corpus acheté sans provenance documentée ne se compare pas dans le temps et ne résiste pas à une contestation, même s'il est volumineux et bien présenté. Ce scénario impose aussi de prévoir la sortie : que reste-t-il exploitable le jour où le contrat s'arrête, et sous quelle forme les données déjà payées demeurent conservables.
Scénario deux : la collecte se déplace vers les traces indirectes
Le deuxième scénario suppose que l'accès direct devienne trop coûteux ou trop risqué, et que l'observation se reporte sur les traces laissées ailleurs. Une entreprise dont le site devient opaque reste décrite par ses partenaires, ses clients, ses fournisseurs, les registres administratifs, les publications sectorielles, les dépôts de marques et les documents de marchés publics.
Cette approche par ricochet a des vertus. Les traces indirectes proviennent de tiers sans intérêt à embellir, et leur valeur probante est souvent supérieure à celle d'une page institutionnelle. Elles sont en revanche partielles, irrégulières et décalées dans le temps, ce qui interdit les séries fines et impose un raisonnement par convergence d'indices plutôt que par mesure directe. La discipline devient alors celle du renseignement en sources ouvertes : distinguer explicitement ce qui est établi, ce qui est probable et ce qui est supposé, et faire figurer ce statut dans la restitution elle-même.
Le tableau met en évidence le déplacement de la compétence critique selon le scénario. Aucune des trois colonnes ne décrit une situation confortable : chacune remplace un problème d'accès par un problème d'interprétation, de budget ou de périmètre. Un dispositif prudent se prépare à fonctionner dans les trois régimes plutôt que de parier sur celui qui l'arrange.
Scénario trois : l'ouverture se maintient par obligation réglementaire
Le troisième scénario est celui d'une ouverture qui ne dépend plus de la bonne volonté des acteurs mais d'obligations de publication. Registres d'entreprises, données de marchés publics, déclarations extra-financières, bases de brevets, informations de conformité : cette matière est publiée parce que la règle l'exige, et elle reste donc accessible même quand le web commercial se referme.
Ce scénario est le plus favorable à la comparabilité, puisque les formats sont normalisés et les calendriers connus. Il est aussi le plus contraint sur le périmètre : la donnée existe seulement là où une obligation existe. Des pans entiers d'activité restent hors champ, et le dispositif décrit alors très bien ce qui est réglementé, très mal le reste.
L'outillage détermine ce qui est effectivement exploitable dans ce régime. NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs langues, trie les signaux par intelligence artificielle et ramène chaque alerte à sa source d'origine, ce qui met les publications réglementaires, la presse spécialisée et les registres dans un même flux qualifiable. La définition du périmètre pertinent reste un travail de l'organisation.
Ce que ces scénarios imposent de décider maintenant
Trois décisions gardent leur valeur quel que soit le scénario réalisé. La première est l'archivage local de ce qui est collecté aujourd'hui, avec horodatage et copie de la page telle qu'elle se présentait. Une source qui se referme demain rend l'archive d'hier irremplaçable, et aucune reconstitution ultérieure ne rattrape une observation non conservée.
La deuxième décision est la documentation de la provenance, champ par champ. Savoir d'où vient un attribut, à quelle date et selon quelle règle d'inclusion, est ce qui distingue un corpus exploitable d'un stock de données. Cette exigence est légère quand elle accompagne la collecte, et pratiquement impossible à reconstituer après coup sur un volume important.
La troisième décision est l'écriture explicite des non-couvertures. Un dispositif honnête énonce ce qu'il ne voit pas : les espaces fermés, les langues absentes, les acteurs qui ne publient pas. Cette liste protège le décideur d'une conclusion tirée d'un silence, qui est l'erreur la plus fréquente et la plus coûteuse de la web intelligence. Tenue à jour, elle constitue aussi la feuille de route des extensions de périmètre à financer en priorité.
Un web qui se referme ne rend pas la web intelligence impossible, il rend obligatoire la déclaration de ce qu'elle ne voit plus.
Questions fréquentes
Qu'est-ce que la web intelligence, précisément ?
C'est l'exploitation systématique de données publiées sur le web pour décrire des acteurs économiques et leurs mouvements : offres d'emploi, prix, technologies, implantations, partenariats. Elle se distingue de la veille de flux par son objet, qui est la donnée structurée et répétée dans le temps, plutôt que l'événement rapporté par une publication.
Une donnée publique est-elle libre de collecte ?
Accessible ne signifie pas librement réutilisable. La question se pose sur trois plans distincts : les conditions d'utilisation du service, la protection des bases de données, et le régime applicable aux données personnelles. Une collecte techniquement possible peut être contractuellement interdite, et cet arbitrage relève du cadre juridique de l'organisation, non de l'équipe technique seule.
Comment interpréter la disparition d'un signal après une fermeture d'interface ?
Comme une perte d'observation, jamais comme une baisse d'activité. C'est la précaution la plus importante du domaine : une rupture de série due à un changement d'accès ressemble exactement à un ralentissement réel. La règle est de documenter chaque changement de collecte dans le corpus lui-même, afin que la rupture reste identifiable des années plus tard.
Faut-il privilégier les sources réglementaires plutôt que le web commercial ?
Les deux ont des rôles complémentaires. Les sources réglementaires offrent stabilité, comparabilité et valeur probante, mais un périmètre limité à ce que la règle impose de publier. Le web commercial offre fraîcheur et granularité, avec une fragilité d'accès élevée. Un dispositif robuste ancre ses séries longues sur les premières et utilise le second pour la détection.