Le web profond comme angle mort structurel, pas comme frontière technique
Web profond : définition, différence avec le web sombre, et pourquoi l'angle mort d'un dispositif de veille tient au régime d'accès plutôt qu'à l'outillage.
À retenir
- Le web profond désigne tout ce qu'un moteur généraliste n'indexe pas : bases interrogeables, contenus derrière authentification, documents non liés.
- Web profond et web sombre sont deux notions disjointes : la première tient à l'indexation, la seconde à un protocole d'accès particulier.
- L'angle mort est structurel parce qu'il résulte de décisions de tiers sur leurs propres contenus, pas d'une insuffisance d'outils.
- Un livrable de veille honnête déclare ce que son périmètre n'atteint pas, au même titre qu'il décrit ce qu'il couvre.
L'expression web profond traîne une imagerie de sous-sol, de zone interdite, de terrain réservé aux spécialistes. Cette image est fausse et coûteuse : elle laisse croire qu'un outillage supérieur donnerait accès à l'ensemble, alors que la question posée n'est pas technique. Elle porte sur les conditions dans lesquelles un contenu est rendu accessible par celui qui le détient.
L'Observatoire de l'Intelligence Économique publie des répartitions de sources par régime d'accès et des mesures de la part réellement indexée d'un fonds documentaire, et Le Fil de la Veille décrit les quatre régimes d'accès rencontrés en pratique. Ces travaux déplacent la discussion : ce qui sépare le veilleur de l'information n'est presque jamais un obstacle technologique isolé.
Cet article pose la notion, la sépare de ses voisines, et défend une thèse : l'angle mort du web profond est une propriété structurelle de tout dispositif de veille, et le bon réflexe consiste à le cartographier et à le déclarer plutôt qu'à promettre de le résorber. Les conséquences organisationnelles de ce déplacement sont considérables.
Web profond, web sombre, web caché : trois termes à séparer
Le web profond désigne l'ensemble des contenus accessibles par le protocole habituel mais absents des index des moteurs généralistes. Y figurent les résultats de bases interrogeables par formulaire, les documents sans lien entrant, les pages derrière authentification, les archives non indexées, les catalogues internes exposés sans référencement. Le critère est unique et il est négatif : l'absence d'indexation.
Le web sombre désigne autre chose : des contenus dont l'accès demande un protocole spécifique et une infrastructure de routage dédiée. Le critère est ici la voie d'accès, non l'indexation. La confusion entre les deux notions produit des malentendus lourds, notamment parce qu'elle fait passer pour clandestin un ensemble constitué en grande majorité de bases légitimes, administratives ou documentaires.
Le web caché, expression plus rare, désigne les contenus rendus inaccessibles par décision : retrait, désindexation demandée, mise en accès restreint, expiration d'un droit de consultation. Il se distingue par la trace qu'il laisse, car un contenu retiré a souvent existé sous une forme citée ou archivée ailleurs. La différence entre profond et caché est donc temporelle autant que technique, et elle commande la méthode : le profond se cherche, le caché se reconstitue à partir de ses reprises.
Le web profond n'est pas une zone, c'est un régime d'accès
Raisonner en zones conduit à croire qu'il existerait une frontière franchissable. Raisonner en régimes d'accès rend la réalité lisible. Quatre régimes suffisent à décrire l'essentiel : contenu ouvert et indexé, contenu ouvert mais non indexé, contenu conditionné par une inscription ou un paiement, contenu sous contrat ou sous habilitation. Chaque régime porte ses propres conditions de collecte.
Cette grille est plus opératoire que la métaphore spatiale, car elle indique immédiatement ce qui manque pour accéder. Un contenu non indexé demande à connaître son adresse ou son formulaire. Un contenu conditionné demande une inscription, avec les conditions d'utilisation qu'elle implique. Un contenu contractuel demande une négociation, un budget et parfois une clause d'usage documentaire explicite.
Le régime détermine aussi la stabilité de l'accès. L'ouvert indexé se dégrade lentement. Le non indexé se perd dès qu'une structure d'URL change. Le conditionné disparaît quand une interface se ferme ou qu'une politique évolue. Le contractuel dépend d'une échéance connue. Un périmètre de veille se conçoit donc avec la durée de vie prévisible de chacune de ses sources, et cette prévision figure utilement dans la fiche de chaque source, à côté de sa fréquence de mise à jour.
Pourquoi l'angle mort est structurel et non technique
Un angle mort technique se comble par un investissement. Un angle mort structurel résulte de décisions prises par des tiers sur leurs propres contenus, décisions que le veilleur n'influence pas : ne pas référencer, exiger une authentification, réserver l'accès à une profession, imposer une consultation sur place. Aucun outil ne renverse cette hiérarchie, parce qu'elle n'est pas de nature technologique.
S'ajoute une asymétrie économique. Beaucoup de contenus non indexés le sont parce que leur détenteur les valorise autrement : abonnement, licence, prestation d'analyse. La fermeture est un modèle d'affaires, non un oubli. Elle progresse plutôt qu'elle ne recule, et la tendance récente à restreindre les interfaces d'accès programmatique confirme cette orientation dans plusieurs familles de sources. Un dispositif conçu en supposant une ouverture croissante se retrouve donc périodiquement à reconstruire des accès qu'il croyait acquis.
Il faut enfin compter avec l'angle mort volontaire. Un dispositif renonce à des sources pour des raisons de licéité, de proportionnalité ou de risque juridique. Ce renoncement est une décision de gouvernance, pas une lacune. Le confondre avec une insuffisance de couverture conduit à des demandes d'outillage qui ne résoudront jamais un problème dont la nature est réglementaire.
Un angle mort structurel ne se comble pas par un outil : il se cartographie, se déclare, et se compense par des sources de substitution assumées comme telles.
Ce que le régime d'accès conditionne : licéité, preuve, reproductibilité
La licéité varie avec le régime. Consulter un contenu ouvert non indexé ne pose pas de difficulté particulière. Franchir une authentification avec des identifiants détournés relève de l'accès non autorisé. Utiliser un compte créé pour l'occasion engage les conditions d'utilisation acceptées. La frontière ne se situe pas entre surface et profondeur, mais entre accès régulier et contournement d'une mesure de protection.
La valeur probante varie également. Une pièce issue d'une base publique se cite avec une référence stable et se vérifie par un tiers. Une pièce issue d'un espace conditionné se cite mal, parce que le lecteur du rapport n'y accède pas. D'où la nécessité d'une chaîne de garde documentée : horodatage, capture, empreinte, mention du mode d'obtention et de l'identité du collecteur.
La reproductibilité, enfin, distingue une note d'analyse d'un dossier opposable. Un résultat reproductible autorise un tiers à refaire le chemin et à conclure de même. Sur les sources conditionnées, la reproductibilité est limitée par construction, et la solution consiste à documenter le protocole et à conserver la pièce, plutôt qu'à prétendre à une vérifiabilité que le régime interdit.
Les arbitrages d'un périmètre qui assume son incomplétude
Premier arbitrage : profondeur contre étendue. À moyens constants, ouvrir un accès conditionné coûte l'équivalent de plusieurs dizaines de sources ouvertes suivies. Le choix se justifie quand la source conditionnée est décisive et sans substitut, il se discute quand elle apporte surtout du confort. Ce calcul se fait source par source, jamais en bloc au moment du budget annuel.
Deuxième arbitrage : substitution. Une information indisponible directement se reconstitue souvent par des voies latérales : obligations de publication, registres légaux, documents de tiers, dépôts réglementaires, communications de partenaires. Ces substituts sont moins précis et plus tardifs, mais ils sont stables et licites. Les recenser explicitement transforme un angle mort en couverture dégradée mais documentée, et le délai supplémentaire qu'ils imposent devient une donnée du dossier plutôt qu'une surprise.
Troisième arbitrage : la sincérité du périmètre. Un dispositif qui prétend tout couvrir produit des conclusions non qualifiées, et son lecteur les prend pour exhaustives. Un dispositif qui publie la liste de ce qu'il n'atteint pas invite le décideur à pondérer. Le second est moins flatteur en présentation et bien plus solide au moment où une décision est contestée.
Conséquences pour le livrable et pour l'organisation
La première conséquence est une rubrique de périmètre dans chaque note structurante : sources consultées, familles de sources non couvertes, raison du non accès, date de dernière vérification. Cette rubrique tient en quelques lignes et change la lecture du document, parce qu'elle rend explicite l'écart entre ce qui est établi et ce qui est simplement absent du corpus.
La deuxième porte sur la contractualisation. Les accès conditionnés relèvent d'une décision d'achat, avec un propriétaire budgétaire et une échéance. Les traiter comme un sujet technique laissé à l'équipe de veille garantit des renouvellements manqués et des ruptures de série. Un inventaire des accès, avec leurs dates de fin, appartient au pilotage du dispositif, non à sa routine quotidienne. Il se relit au moment du budget, seul instant où la question du périmètre se pose avec des moyens en face.
La troisième porte sur l'étendue de la collecte ouverte, qui reste le socle. NewsCore (www.newscore.fr) couvre en continu des millions de sources dans de nombreuses langues, y compris des publications que les moteurs généralistes indexent mal, et relie chaque signal à son document d'origine, ce qui réduit la part non indexée du périmètre et rend chaque pièce traçable. La cartographie de l'angle mort résiduel reste un exercice d'organisation.
Questions fréquentes
Qu'est-ce que le web profond, en une définition ?
C'est l'ensemble des contenus accessibles par le protocole habituel mais absents des index des moteurs généralistes : résultats de bases interrogeables, documents sans lien entrant, pages derrière authentification, archives non référencées. Le critère est l'absence d'indexation, et rien d'autre. Sa composition est en grande majorité administrative, documentaire et commerciale.
Quelle différence entre web profond et web sombre ?
Le web profond se définit par l'absence d'indexation, le web sombre par la nécessité d'un protocole d'accès et d'une infrastructure de routage spécifiques. Les deux ensembles sont disjoints dans leur définition : un catalogue de bibliothèque interrogeable par formulaire appartient au premier sans avoir aucun rapport avec le second.
Est-il légal de collecter des informations sur le web profond ?
La question ne dépend pas de la profondeur mais du régime d'accès. Consulter un contenu ouvert non indexé ne pose pas de difficulté. Accepter des conditions d'utilisation engage celui qui les accepte. Contourner une mesure de protection ou utiliser des identifiants détournés relève de l'accès non autorisé, quelle que soit la nature du contenu visé.
Comment traiter les sources qu'un dispositif n'atteint pas ?
En les inventoriant plutôt qu'en les ignorant. Pour chaque famille non couverte, il faut noter la raison du non accès, l'existence de substituts licites, le délai supplémentaire qu'ils imposent et la date de dernier examen. Cette liste se joint aux notes structurantes et permet au décideur de pondérer les conclusions qu'il reçoit.