mercredi 7 octobre 2026
Prospective

Le web profond, périmètre en expansion ou en clôture

Définition du web profond, distinction avec le web sombre, et analyse des deux forces contraires qui élargissent ou referment ce périmètre pour la veille.

La rédaction1 septembre 20268 min de lecture

À retenir

  • Le web profond se définit par un seul critère, la non-indexation par les moteurs généralistes, et non par l'illégalité: confondre web profond et web sombre fausse l'évaluation du risque comme celle de l'effort de collecte.
  • Deux forces contraires agissent sur ce périmètre: l'authentification généralisée et les contenus produits à la demande l'élargissent, les obligations de publication et les portails de données le referment.
  • Pour un dispositif de veille, la question utile n'est pas la taille du web profond mais la part de ses propres sources critiques qui exige un accès conditionnel documenté.
  • Trois hypothèses de travail: la clôture par authentification, l'ouverture par obligation réglementaire, et la disparition de la notion au profit d'une échelle de coût d'accès.

Peu de notions du métier de la veille souffrent d'autant de confusion que celle de web profond. Le terme circule tantôt comme synonyme de zone criminelle, tantôt comme promesse de gisement documentaire inexploité, alors qu'il ne désigne à l'origine qu'une propriété technique très étroite: le fait de ne pas figurer dans l'index des moteurs de recherche généralistes. Cette imprécision a un coût direct, car elle conduit des organisations à surinvestir dans la surveillance de darknets marginaux tout en ignorant des bases publiques parfaitement légales et pourtant invisibles depuis un moteur.

La question posée par le titre est donc moins spectaculaire qu'elle n'y paraît, et bien plus opérationnelle. Le périmètre non indexé s'étend-il, sous l'effet de l'authentification généralisée et des contenus produits à la demande, ou se referme-t-il, sous l'effet des obligations de publication et des portails de données ouvertes? Les constats méthodologiques de l'Observatoire de l'Intelligence Économique sur la traçabilité des sources primaires invitent à répondre séparément pour chaque strate, parce que les deux mouvements se produisent en même temps sur des matières différentes.

Web profond, web sombre, web invisible: trois notions à ne pas confondre

Le web profond regroupe l'ensemble des ressources accessibles par les protocoles ordinaires du web mais absentes des index généralistes: pages derrière un formulaire de recherche, bases de données interrogeables ressource par ressource, documents réservés aux abonnés, espaces professionnels, intranets exposés, contenus dont l'éditeur bloque l'exploration automatique. Le web sombre, lui, se définit par le protocole d'accès: il faut un réseau superposé, un logiciel dédié et souvent une adresse communiquée de la main à la main. La différence n'est pas de degré mais de nature, et elle commande des méthodes, des autorisations et des risques différents.

Le terme de web invisible, plus ancien, décrivait la même réalité que le web profond à l'époque où les moteurs n'exploraient guère les contenus dynamiques. Il a vieilli parce que l'indexation a progressé, ce qui rappelle un point essentiel: la frontière du web profond n'est pas une propriété du contenu, c'est une propriété de la relation entre ce contenu et les robots qui tentent de l'atteindre. Un document peut sortir du web profond sans avoir changé, simplement parce qu'un moteur a appris à remplir le formulaire qui y menait.

Le seul critère qui délimite vraiment le web profond

Une définition opérationnelle tient en une question: un moteur généraliste, laissé à lui-même, atteindrait-il ce document? Si la réponse est non pour une raison technique (formulaire, paramètre d'interrogation, blocage d'exploration, format non lisible, volumétrie décourageante), le document appartient au web profond. Si la réponse est non pour une raison d'autorisation (identifiants nécessaires, contrat, habilitation), il appartient au web fermé et sort du périmètre de collecte licite. Cette distinction entre non indexé et non autorisé est celle que les dispositifs de veille documentent le moins bien, alors qu'elle sépare une difficulté d'ingénierie d'une question de conformité.

Il en découle une conséquence contre-intuitive: l'essentiel du web profond utile à l'intelligence économique est public. Registres d'entreprises, avis d'appels d'offres, décisions administratives, bases de brevets, dépôts réglementaires, archives de délibérations locales, publications scientifiques, tous ces gisements sont ouverts, gratuits pour une bonne part, et pourtant absents des résultats d'une recherche ordinaire parce qu'ils ne s'atteignent qu'en interrogeant un formulaire. Le travail de veille sur le web profond ressemble donc moins à une enquête clandestine qu'à un exercice patient de recensement des points d'interrogation disponibles.

Ce qui fait grossir le périmètre non indexé

Trois dynamiques élargissent la zone non indexée. La première est la généralisation de l'authentification: des contenus autrefois consultables librement se retrouvent derrière une inscription, ne serait-ce que pour mesurer l'audience. La deuxième est le déplacement d'une partie de la publication vers des applications qui n'exposent pas de pages, mais des flux internes que nul moteur n'explore. La troisième, plus récente, est la production de contenus à la demande: une réponse générée pour un utilisateur n'existe pas comme document stable, donc n'a pas d'adresse à indexer, donc échappe par construction à toute logique d'archivage.

Cette troisième dynamique change la nature du problème. Jusqu'ici, le web profond contenait des documents existants mais difficiles à atteindre; il commence à contenir des énoncés qui n'existent qu'au moment où ils sont demandés. Une organisation qui suit son image ou une controverse ne peut plus supposer que tout ce qui a été lu quelque part est conservé quelque part. C'est une rupture méthodologique: la preuve documentaire, socle du travail de veille, devient dépendante d'une capture faite au bon moment plutôt que d'une consultation ultérieure.

Ce qui referme le périmètre

Le mouvement inverse est réel et souvent sous-estimé. Les obligations de publication imposées aux administrations comme aux entreprises versent chaque année davantage de matière dans des portails structurés, avec des formats normalisés et des interfaces d'accès documentées. Ce qui exigeait hier une interrogation manuelle d'un formulaire s'obtient aujourd'hui par un jeu de données téléchargeable, avec un historique et un calendrier de mise à jour. Sur ces matières, la frontière du web profond recule, non parce que les moteurs progressent, mais parce que les producteurs de données publient autrement.

Les reportages publiés par Le Fil de la Veille sur les pratiques des équipes documentaires montrent que ce recul profite surtout aux organisations qui ont investi dans la connaissance des producteurs de données plutôt que dans des outils de recherche généralistes. Savoir qui publie quoi, à quelle échéance et sous quelle forme vaut davantage que la capacité à interroger vite un index. Le web profond se referme pour ceux qui connaissent les guichets, et reste opaque pour ceux qui n'attendent la matière que des moteurs.

Le web profond n'est pas un territoire, c'est une distance: celle qui sépare un document du robot qui aurait pu le trouver.

Prospective: trois hypothèses sur l'évolution du périmètre

Première hypothèse, la clôture par authentification. La part des contenus conditionnés à une inscription continue de croître, et la veille se réorganise autour d'abonnements documentés plutôt que de collecte automatisée. Le signal qui confirmerait cette hypothèse est la multiplication des sources critiques dont l'accès figure dans un contrat, et l'apparition d'une fonction interne chargée de gérer ce portefeuille d'accès comme un actif.

Deuxième hypothèse, l'ouverture par obligation. Les exigences de transparence financière, environnementale et administrative produisent plus de données structurées qu'il ne s'en ferme ailleurs, et le solde net du web profond utile diminue. Le signal serait la bascule d'une majorité des sources primaires d'un secteur vers des portails à format stable, avec des séries historiques exploitables sans travail d'extraction.

Troisième hypothèse, la dissolution de la notion. Le couple indexé ou non indexé cède la place à une échelle continue de coût d'accès, mesurée en temps d'ingénierie, en droits acquis et en risque juridique. Le signal serait l'abandon du vocabulaire de la profondeur dans les cahiers des charges, remplacé par une cartographie de sources classées par coût et par fiabilité. Cette hypothèse est la plus probable des trois, et la moins confortable, parce qu'elle prive les équipes d'une frontière simple à expliquer.

Conséquences pour un dispositif de veille

La première conséquence est documentaire: une cartographie de sources doit indiquer, pour chaque gisement, son mode d'accès, sa fréquence de mise à jour, sa forme de restitution et le nom du producteur. Sans cette fiche, une équipe redécouvre le même formulaire tous les six mois. La deuxième est probatoire: sur les contenus volatils, la capture datée et la conservation de l'adresse d'origine deviennent des obligations de méthode, au même titre que la chaîne de garde dans une enquête.

La troisième conséquence porte sur l'outillage. Le socle doit couvrir largement la surface indexée pour libérer du temps d'analyste au profit des gisements profonds, qui exigent un travail sur mesure. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, trie les publications par pertinence et relie chaque signal à sa publication d'origine, ce qui concentre l'effort humain sur les sources qui demandent une interrogation spécifique. Le recensement des guichets sectoriels, lui, reste une compétence interne, entretenue par les documentalistes et les analystes du domaine.

Questions fréquentes

Quelle est la définition du web profond?

Le web profond désigne les ressources accessibles par les protocoles habituels du web mais absentes des index des moteurs généralistes, généralement parce qu'elles ne s'obtiennent qu'en interrogeant un formulaire, en parcourant une base de données ou en franchissant une restriction d'exploration. La définition ne dit rien de la légalité des contenus ni de leur intérêt: une base réglementaire publique et un forum obscur y cohabitent, et l'essentiel de sa valeur pour l'intelligence économique se trouve dans des sources parfaitement officielles.

Quelle différence entre web profond et web sombre?

Le web profond se définit par la non-indexation, le web sombre par le protocole d'accès, puisqu'il exige un réseau superposé et un logiciel spécifique. Le premier se travaille avec des méthodes documentaires ordinaires, le second suppose un cadre juridique explicite, des précautions de sécurité et souvent une compétence spécialisée. Les traiter comme un même objet conduit soit à dramatiser une recherche en base publique, soit à sous-estimer les précautions nécessaires sur un darknet.

Faut-il surveiller le web profond pour faire de la veille concurrentielle?

Oui, mais en le nommant correctement: la matière utile réside dans les registres, les dépôts réglementaires, les avis de marchés, les bases de brevets et les publications sectorielles, tous non indexés et tous publics. La démarche consiste à recenser ces guichets un par un, à noter leur calendrier et à automatiser leur interrogation quand elle est autorisée, plutôt qu'à chercher un accès privilégié à des espaces fermés qui n'apporteraient ni preuve utilisable ni sécurité juridique.

Pour approfondir