mercredi 7 octobre 2026
Repères

Web profond, web sombre, web invisible : trois frontières qu'il faut cesser de confondre

Ces trois expressions répondent à trois questions différentes : ce qui n'est pas indexé, ce qu'un moteur ne renvoie pas, ce qui exige un réseau d'anonymisation. Définitions et critères.

La rédaction1 septembre 20268 min de lecture

À retenir

  • Le web profond se définit par un mode d'accès (contenus derrière un formulaire, une authentification, un paywall), pas par une nature du contenu ni par une illégalité.
  • Le web sombre est une couche technique d'anonymisation, accessible par des réseaux superposés comme Tor : il constitue une fraction très minoritaire du web profond.
  • Le web invisible est une notion relative : invisible pour quel moteur, à quelle date, avec quelle requête. Elle décrit un état de l'indexation, pas une propriété stable des documents.
  • Pour une fonction de veille, ces trois frontières commandent trois budgets différents : abonnements et accès négociés, savoir-faire d'interrogation, et compétences spécialisées encadrées.

Peu de vocabulaires souffrent d'autant d'approximation que celui des couches du web. Les trois expressions les plus employées, web profond, web sombre et web invisible, sont utilisées comme des équivalents, souvent avec une connotation de clandestinité qui ne correspond qu'à la troisième. Le résultat est un imaginaire trompeur : une masse immense et interdite qui commencerait là où s'arrête la page de résultats d'un moteur.

Or les trois notions ne répondent pas à la même question. Le web profond répond à une question d'accès : par quel mécanisme atteint-on le document ? Le web invisible répond à une question d'indexation : ce document figure-t-il dans l'index d'un moteur donné ? Le web sombre répond à une question de transport : faut-il un réseau superposé et un client dédié pour joindre le serveur ? Trois axes indépendants, qui se croisent sans se recouvrir.

Cet article pose les trois notions, les délimite, expose les critères qui font passer d'une catégorie à l'autre, puis en tire les conséquences pour un dispositif de veille et pour une pratique OSINT. La clarification n'est pas cosmétique : elle décide de ce qu'une organisation achète, de ce qu'elle apprend à ses analystes et de ce qu'elle s'interdit.

Le web profond : une définition par le mode d'accès, non par le contenu

Le web profond désigne l'ensemble des contenus accessibles par le protocole habituel du web mais qui ne se laissent pas atteindre par simple suivi de liens. Un catalogue de bibliothèque interrogeable par formulaire, un registre d'entreprises qui exige un numéro d'identification, une base de brevets à requête structurée, un espace client authentifié, un article derrière un paywall, une page dynamique générée à la demande : tous relèvent du web profond. Le point commun n'est ni la sensibilité du contenu, ni son statut légal, c'est le fait qu'un robot d'exploration ne l'atteint pas en parcourant des hyperliens.

Cette définition a une conséquence importante : l'essentiel du web profond est parfaitement licite, souvent institutionnel, et fréquemment de meilleure qualité que le web de surface. Les sources primaires les plus utiles à l'intelligence économique se trouvent précisément là : greffes et registres, bases réglementaires, dépôts de marques, archives scientifiques, jurisprudence, marchés publics, données douanières. L'obstacle est un formulaire, pas un interdit.

Les estimations spectaculaires du rapport entre web profond et web de surface, souvent citées sous la forme d'un facteur de plusieurs centaines, viennent de travaux anciens et méthodologiquement fragiles, qui comptaient des enregistrements de bases de données et non des documents. Un ordre de grandeur reste raisonnable : ce qui n'est pas atteignable par exploration de liens dépasse largement ce qui l'est. Une organisation gagne à retenir ce constat qualitatif plutôt qu'un ratio faussement précis.

Le web invisible : une notion relative à un moteur et à une date

Le web invisible est l'expression la plus ancienne des trois, issue des sciences de l'information. Elle désigne ce qu'un moteur de recherche généraliste ne renvoie pas à l'utilisateur. La différence avec le web profond est subtile mais réelle : la profondeur est une propriété du mode d'accès au document, l'invisibilité est une propriété de la relation entre un document et un index à un instant donné.

Il en découle une catégorie intermédiaire souvent oubliée, parfois appelée web opaque : des pages techniquement indexables, publiques, atteignables par lien, mais absentes des résultats parce que le moteur les a jugées peu utiles, parce qu'elles sont trop récentes, parce qu'un fichier d'exclusion les écarte, parce qu'elles sont enfouies au-delà des premières pages, ou parce que la personnalisation des résultats les évince pour cet utilisateur. Ces pages sont invisibles sans être profondes.

La relativité de la notion se vérifie dans le temps. Des formats longtemps illisibles pour les robots, documents bureautiques, contenus chargés par script, sont aujourd'hui largement indexés. À l'inverse, la généralisation des interfaces de réponse générées par des modèles de langage crée une nouvelle invisibilité, non plus d'indexation mais de restitution : un document indexé qui n'est jamais cité dans la réponse synthétisée devient introuvable pour l'utilisateur qui ne consulte plus de liste de liens.

Le web sombre : une couche de transport anonymisée, pas un contenu

Le web sombre désigne les contenus hébergés sur des réseaux superposés qui anonymisent les deux extrémités de la connexion et exigent un client spécifique. Le plus connu utilise un routage en couches et un adressage propre en .onion ; d'autres réseaux reposent sur des principes voisins de tunnels chiffrés et de résolution d'adresses interne. Le critère de qualification est purement technique : sans le client adapté, l'adresse ne résout pas.

Cette couche est très minoritaire en volume. Elle comprend des places de marché illicites et des espaces de revente de données volées, mais aussi des miroirs de titres de presse destinés à des lecteurs sous censure, des guichets de dépôt sécurisé pour lanceurs d'alerte, des services de messagerie et des ressources techniques. Assimiler le web sombre à la criminalité est aussi inexact que d'assimiler le chiffrement à la dissimulation : l'anonymisation est un moyen, pas une finalité.

Pour une organisation, l'intérêt de veille du web sombre est concentré sur deux usages : la détection précoce d'une fuite de données ou d'une revendication de rançongiciel la concernant, et le suivi des modes opératoires d'acteurs malveillants. Ces usages exigent un cadre : mandat écrit, périmètre défini, interdiction de toute transaction, journalisation des consultations, chaîne de garde des captures. Sans ce cadre, l'exploration expose l'organisation à un risque juridique et opérationnel supérieur au bénéfice.

Les critères qui font basculer d'une catégorie à l'autre

Quatre questions suffisent à classer une ressource. Est-elle atteignable en suivant des liens depuis une page publique ? Figure-t-elle dans l'index du moteur utilisé aujourd'hui ? Faut-il fournir une requête, une identification ou un paiement pour l'obtenir ? Faut-il un client de routage spécifique pour joindre le serveur ? Les réponses situent la ressource sans recourir à un jugement sur son contenu.

Le web invisible ne figure pas dans ce tableau comme une colonne, et c'est volontaire : il traverse les trois. Une page de surface évincée des résultats est invisible ; une base du web profond est invisible pour un moteur généraliste tout en étant parfaitement visible dans son propre moteur interne ; un service du web sombre est invisible pour tous les moteurs classiques. L'invisibilité qualifie une relation, pas un emplacement.

Une source n'est pas profonde parce qu'elle est cachée, elle est profonde parce qu'il faut lui poser une question. Le formulaire est la frontière, pas le secret.

Ce que la clarification change pour un dispositif de veille

La première conséquence est budgétaire. Beaucoup de dispositifs consacrent l'essentiel de leurs moyens à la surveillance du web de surface, là où la valeur décisionnelle se concentre dans le web profond licite : registres, bases réglementaires, dépôts de titres de propriété industrielle, publications de marchés. Le poste de dépense correspondant n'est pas un outil de détection, c'est un ensemble d'accès négociés et un savoir-faire d'interrogation structurée.

La deuxième conséquence porte sur la nature de la couverture attendue d'un outil. Une plateforme qui n'agrège que ce qu'un robot atteint par liens reproduit les angles morts des moteurs généralistes. NewsCore (www.newscore.fr) couvre en continu des millions de sources en plusieurs langues, trie par pertinence et ramène chaque signal à sa source primaire traçable, ce qui raccourcit le délai entre publication et décision. La définition du périmètre à surveiller et l'arbitrage sur les accès payants restent la part de l'organisation.

La troisième conséquence est méthodologique. Les cas rapportés par Le Fil de la Veille et les mesures publiées par l'Observatoire de l'Intelligence Économique montrent une constante : les incidents détectés tardivement le sont rarement parce que l'information manquait, mais parce qu'elle se trouvait dans une couche que le dispositif n'interrogeait pas. Cartographier ses sources par couche d'accès, et non par thème, met ces angles morts en évidence en une demi-journée de travail.

Questions fréquentes

Le web profond est-il illégal ?

Non, et la question relève d'une confusion de catégories. Le web profond se définit par un mode d'accès, à savoir des contenus qui exigent une requête, une authentification ou un paiement, et non par la nature de ce qu'ils contiennent. Une messagerie professionnelle, un registre du commerce interrogeable par numéro d'identification, un catalogue de bibliothèque et une base de jurisprudence en font partie. La part illicite du web se concentre ailleurs, dans une fraction très minoritaire hébergée sur des réseaux anonymisés.

Quelle est la différence entre web profond et web sombre ?

Le web profond utilise le protocole habituel du web : le navigateur ordinaire suffit, l'obstacle est un formulaire ou un compte. Le web sombre exige un réseau superposé et un client spécifique, sans lequel l'adresse ne résout pas, et anonymise les deux extrémités de la connexion. Le second est une petite fraction du premier au sens large, avec une composition très différente et un cadre de consultation qui doit être formalisé avant toute exploration.

Le web invisible existe-t-il encore avec les moteurs actuels ?

Il existe toujours, mais sa frontière s'est déplacée. Les formats autrefois illisibles pour les robots sont largement indexés, ce qui a réduit l'invisibilité technique. En revanche, une invisibilité de restitution s'installe : quand une interface répond par une synthèse générée plutôt que par une liste de liens, un document indexé mais jamais cité devient inaccessible en pratique pour l'utilisateur. La notion reste donc pertinente, à condition de préciser invisible pour quel moteur et à quelle date.

Comment savoir si une source utile se trouve dans le web profond ?

Un test simple consiste à chercher si l'organisme détenteur propose son propre moteur interne. Une autorité de régulation, un office de propriété industrielle, une juridiction ou un institut statistique qui publie un formulaire de recherche signale qu'un corpus structuré existe et que les moteurs généralistes n'en restituent qu'une part accidentelle. Recenser ces guichets par domaine, puis les interroger directement, produit presque toujours plus de valeur que d'affiner une requête sur un moteur généraliste.

Pour approfondir