Web ouvert, web profond, web fermé, web sombre : quatre définitions à tenir
Le web profond n'est pas le web sombre, et le web fermé n'est ni l'un ni l'autre. Quatre définitions fondées sur le critère d'accès, leurs frontières et ce que chacune apporte en veille.
À retenir
- Les quatre couches se définissent par leur mode d'accès, jamais par la nature ou la légalité de leur contenu.
- Le web profond regroupe les pages accessibles mais non indexées : c'est la matière première ordinaire de la veille.
- Le web fermé suppose une autorisation, donc une règle contractuelle qui s'applique à la collecte.
- Le web sombre désigne les réseaux à routage anonymisant, un périmètre étroit et rarement décisif en intelligence économique.
Peu de notions sont aussi mal employées que celles de web profond et de web sombre. Elles sont traitées comme des synonymes dans les présentations commerciales, alors qu'elles décrivent deux réalités sans rapport : l'une désigne ce qu'un moteur n'a pas indexé, l'autre un ensemble de réseaux utilisant un routage anonymisant. La confusion produit des attentes fausses.
Ce repère propose quatre définitions fondées sur un critère unique et vérifiable : le mode d'accès. Web ouvert, web profond, web fermé et web sombre ne se distinguent ni par le caractère licite du contenu, ni par sa sensibilité, ni par sa valeur. Ils se distinguent par ce qu'il faut faire, techniquement et juridiquement, pour y accéder.
Les analyses de l'Observatoire de l'Intelligence Économique sur la composition des corpus, comme les reportages publiés par Le Fil de la Veille sur les pratiques de collecte, convergent sur un point : l'essentiel du gisement utile en intelligence économique se trouve dans le web profond et le web fermé, pas dans les réseaux anonymisés que la littérature commerciale met en avant. Cette hiérarchie du gisement mérite d'être rappelée avant tout choix d'outil.
Quatre couches définies par leur critère d'accès, non par leur contenu
Le critère d'accès se décline en quatre situations. Une page est indexée par les moteurs généralistes : web ouvert. Elle est accessible librement mais absente des index : web profond. Elle exige une authentification ou une acceptation de conditions : web fermé. Elle n'est joignable que par un réseau à routage anonymisant : web sombre.
Cette grille présente un avantage décisif : elle est testable. On vérifie qu'une page apparaît dans un index, qu'elle répond sans identification, qu'elle demande un compte, ou qu'elle exige un client réseau particulier. Aucune de ces vérifications ne suppose un jugement sur la valeur du contenu, ce qui rend la classification stable entre analystes.
Elle évite aussi l'erreur symétrique la plus répandue, qui consiste à associer une couche à un niveau de sensibilité. Une base de brevets, un registre d'appels d'offres ou un catalogue de bibliothèque relèvent du web profond sans rien de confidentiel. Inversement, une donnée sensible circule parfois en clair sur le web ouvert, pleinement indexée. La couche décrit un mode d'accès, jamais un degré de confidentialité.
Le web ouvert : indexable, citable, mais très minoritaire en volume
Le web ouvert rassemble les pages atteignables par un lien et autorisées à l'indexation. C'est la couche la plus commode : elle se cite facilement, s'archive sans obstacle et se partage avec un tiers sans discussion sur la provenance. C'est aussi celle qui structure la perception commune du web, puisqu'elle est la seule que la plupart des utilisateurs rencontrent.
Sa faiblesse est double. Elle représente une fraction minoritaire du contenu accessible, et elle est fortement biaisée par les logiques de référencement : ce qui est optimisé remonte, ce qui n'est pas optimisé disparaît, même quand la qualité informationnelle s'établit dans l'ordre inverse. Un corpus limité au web ouvert reproduit donc les priorités des moteurs.
En veille, cette couche sert de point d'entrée et de matériau de vérification publique, rarement de gisement principal. Elle donne le contexte, les prises de parole officielles et l'écho médiatique. Elle ne donne ni la donnée réglementaire fine, ni les documents techniques, ni les signaux faibles qui précèdent une annonce, tous logés plus profondément. Un corpus sérieux se juge donc à ce qu'il contient au-delà de cette première couche.
Le web profond : accessible et non indexé, le vrai gisement de la veille
Le web profond désigne les contenus accessibles sans autorisation particulière mais absents des index généralistes, le plus souvent parce qu'ils sont générés par une requête dans un formulaire. Bases de brevets, jurisprudence, registres d'entreprises, marchés publics, publications scientifiques, archives municipales : la liste couvre la majorité des sources primaires utiles à une analyse sérieuse.
Sa non-indexation n'a rien de volontaire ni de suspect. Un moteur généraliste ne remplit pas les formulaires et n'explore pas les combinaisons de paramètres, ce qui laisse hors index des ensembles considérables mais parfaitement publics. La conséquence méthodologique est claire : on n'atteint pas le web profond en cherchant mieux, on l'atteint en s'adressant directement aux bases. Cette propriété technique, et non un quelconque secret, explique l'essentiel de l'invisibilité constatée.
C'est pourquoi la valeur d'un dispositif de veille se mesure d'abord au nombre de sources primaires interrogées directement, avant toute considération d'interface ou d'intelligence artificielle. Une couverture large de ces bases produit des délais de détection courts, parce que l'information réglementaire ou contentieuse y apparaît souvent plusieurs jours avant toute reprise médiatique. Le délai de détection se gagne à cet endroit, bien plus que dans l'analyse ultérieure des textes collectés.
Le web fermé : un accès conditionné à une autorisation, donc à une règle
Le web fermé regroupe ce qui exige une identification : espaces professionnels, réseaux sociaux nécessitant un compte, intranets de partenaires, bases payantes, groupes de discussion sur invitation. La frontière avec le web profond n'est pas technique mais contractuelle : l'accès est subordonné à des conditions d'utilisation que la collecte doit respecter, sous peine de conséquences juridiques.
Cette couche pose la question la plus délicate en veille. Un compte créé pour observer un groupe fermé engage la responsabilité de l'organisation, y compris quand l'information recueillie est banale. La règle praticable consiste à distinguer l'accès autorisé et transparent, admissible, de l'accès obtenu par dissimulation d'identité ou de finalité, qui expose l'organisation et son analyste. La transparence de l'accès constitue le critère le plus robuste, parce qu'il se vérifie après coup.
En pratique, la valeur du web fermé provient moins du secret des contenus que de leur granularité : discussions techniques entre praticiens, retours d'expérience, signaux de recrutement ou d'insatisfaction. Une politique de collecte écrite, indiquant quelles plateformes sont ouvertes à quel usage, vaut mieux qu'un arbitrage rendu au cas par cas dans l'urgence. Elle évite aussi que la décision repose sur l'appréciation isolée d'un analyste sous pression.
Le web sombre : des réseaux anonymisants, un périmètre étroit
Le web sombre désigne les services accessibles uniquement via un réseau à routage anonymisant, dont les plus connus reposent sur des chaînes de relais chiffrés. Sa caractéristique est l'anonymisation des deux extrémités, pas l'illégalité : on y trouve des marchés criminels, mais aussi des messageries protégées et des miroirs de médias soumis à censure.
Son intérêt en intelligence économique reste limité et souvent surestimé. Deux usages justifient une surveillance : la recherche de données de l'organisation mises en vente après une compromission, et le suivi de forums où s'annoncent certaines attaques. En dehors de ces cas, l'apport marginal est faible au regard du coût et du risque assumés. Hors ces deux cas, la surveillance permanente de ces réseaux mobilise des ressources rares pour un rendement faible.
La collecte y demande en outre un cadre strict : environnement isolé, absence de toute interaction avec les vendeurs, conservation horodatée des captures, mandat écrit. Sans ces précautions, l'organisation prend un risque juridique et opérationnel disproportionné pour une information dont la valeur probante est, dans la plupart des dossiers, difficile à établir devant un tiers. La proportionnalité s'apprécie ici au regard de l'objectif poursuivi, pas de la curiosité technique.
Ce que les quatre couches changent en méthode et en cadre juridique
Chaque couche appelle un régime de collecte distinct. Le web ouvert se surveille par flux et alertes. Le web profond se travaille par interrogation directe de bases identifiées et documentées. Le web fermé se traite sous politique écrite et comptes déclarés. Le web sombre relève d'une mission ponctuelle, mandatée, tracée et confiée à un profil spécialisé. Écrire ces quatre régimes dans une politique de collecte évite les arbitrages improvisés.
L'enjeu instrumental porte donc sur l'étendue et la traçabilité, non sur la profondeur affichée. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, interroge directement les bases primaires plutôt que les seuls index généralistes et ramène chaque signal à sa source d'origine, ce qui raccourcit le délai entre publication et qualification par une équipe.
Le web profond n'est pas caché, il est simplement non indexé. Le confondre avec le web sombre fait chercher très loin ce qui se trouve dans un registre public.
Questions fréquentes
Quelle est la différence entre web profond et web sombre ?
Le web profond regroupe des contenus librement accessibles mais absents des index, généralement parce qu'ils s'obtiennent via un formulaire de recherche. Le web sombre regroupe des services joignables uniquement par un réseau à routage anonymisant. Le premier est vaste, public et central en veille ; le second est étroit, spécialisé et utile surtout au suivi des fuites de données. Confondre les deux conduit à sous-investir là où se trouve réellement la matière.
Le web profond représente-t-il vraiment la majorité du web ?
Les estimations circulant sur cette proportion sont fragiles, faute de définition partagée de l'unité mesurée. Ce qui est solide, en revanche, tient à la nature des contenus : registres, jurisprudence, brevets, marchés publics et publications scientifiques y résident, ce qui suffit à en faire le gisement principal d'une veille appuyée sur des sources primaires.
Est-il légal de collecter des informations dans le web fermé ?
Tout dépend du mode d'accès. Utiliser un compte régulier en respectant les conditions d'utilisation reste admissible dans la plupart des situations. Dissimuler son identité ou sa finalité pour entrer dans un espace réservé expose l'organisation, indépendamment du caractère anodin de l'information obtenue. Une politique de collecte écrite et validée juridiquement règle la question en amont.
Faut-il surveiller le web sombre quand on fait de la veille concurrentielle ?
Rarement, et jamais en priorité. L'information concurrentielle utile se trouve dans les registres, les brevets, les appels d'offres et les publications sectorielles, donc dans le web profond. La surveillance des réseaux anonymisés se justifie pour un objectif précis, la détection de données compromises, et se conduit sous mandat écrit avec une chaîne de garde rigoureuse.