Cartographier un concurrent par automatisation : où passe la ligne
Reconstituer un organigramme à partir de profils publics est légal en apparence. Analyse des quatre critères qui séparent une observation légitime d'une collecte intrusive.
À retenir
- L'automatisation ne change pas la nature des données collectées, elle change l'échelle, la vitesse et la finalité, trois paramètres que le droit et l'éthique regardent.
- Le caractère public d'une information ne la rend pas librement collectable : la finalité de la collecte reste le critère déterminant.
- Les fonctions anti-détection déplacent la question, car contourner une mesure de protection signale la conscience d'un franchissement.
- Un organigramme reconstitué par classification automatique porte une marge d'erreur qui doit figurer dans le livrable, pas dans les regrets.
Reconstituer l'organisation d'un concurrent à partir de ce que ses collaborateurs publient eux-mêmes est une pratique ancienne de l'intelligence économique. Faite à la main, elle demande des semaines et se heurte naturellement à sa propre lenteur. Outillée, elle s'exécute en quelques minutes sur des centaines d'entreprises, et cette différence d'échelle transforme une pratique tolérée en question sérieuse.
Bright Coding décrit un outil open source qui automatise la collecte d'informations organisationnelles publiques sur un réseau professionnel, selon une chaîne en quatre temps : découverte d'entreprises par région, extraction des profils d'employés, classification des rôles par niveau hiérarchique et par département, puis visualisation en organigramme interactif. La même source indique que l'outil embarque des fonctions anti-détection et une option d'assistance par modèle de langage.
Le Fil de la Veille a présenté cet outil et son fonctionnement. Nous posons ici la question qui vient ensuite : à partir de quel moment une collecte d'informations publiques cesse d'être une observation légitime. La réponse ne tient pas au caractère public des données, qui est acquis, mais à quatre paramètres que l'automatisation modifie tous les quatre simultanément.
Ce que la chaîne en quatre temps automatise vraiment
Les deux premières étapes, découverte d'entreprises par région puis extraction des profils, relèvent de la collecte. Elles reproduisent mécaniquement ce qu'un analyste ferait à la main, avec un facteur d'échelle considérable. C'est le maillon où le volume traité change de nature : une constitution manuelle de corpus impose des choix, une constitution automatique impose seulement des filtres.
La troisième étape, la classification des rôles par niveau hiérarchique et par département, relève de l'inférence. Elle ne se contente plus de reproduire une information déclarée, elle en produit une nouvelle en interprétant des intitulés de poste hétérogènes. C'est le maillon le plus intéressant analytiquement, et le plus exposé à l'erreur, car un intitulé ne décrit ni un périmètre réel ni une position effective.
La quatrième étape, la visualisation en organigramme interactif, relève de la représentation. Elle produit un objet d'une grande force de conviction, qui donne à des inférences incertaines l'apparence d'un document officiel. Ce glissement est le principal risque méthodologique de la chaîne : la qualité graphique du livrable finit par masquer la fragilité des étapes qui l'ont produit.
Public ne veut pas dire librement collectable
L'argument le plus fréquent en défense de ces pratiques tient en une phrase : les données sont publiques, leurs titulaires les ont publiées volontairement. L'argument est exact sur les faits et insuffisant en droit. Une donnée personnelle rendue accessible reste une donnée personnelle, et sa réutilisation pour une finalité étrangère à celle de la publication constitue un traitement à part entière.
La finalité est ici le critère central. Un profil professionnel est publié pour être vu par des recruteurs, des pairs, des clients potentiels. L'agréger avec des centaines d'autres pour reconstituer la structure interne d'un employeur relève d'une finalité que son auteur n'a pas envisagée. L'écart entre finalité de publication et finalité de collecte mesure assez bien le degré d'intrusion.
S'ajoutent les conditions contractuelles de la plateforme, distinctes du droit des données personnelles. Une collecte automatisée contrevient généralement aux conditions d'utilisation, ce qui expose à un contentieux contractuel indépendamment de toute question de vie privée. Une organisation qui emploierait ce type d'outil s'expose donc sur deux terrains juridiques qu'il serait imprudent de confondre ou de traiter ensemble.
Les fonctions anti-détection déplacent la question éthique
Bright Coding mentionne des fonctions anti-détection intégrées à l'outil. Ce détail technique a une portée qui dépasse la technique. Une mesure de protection existe parce qu'un exploitant a décidé de limiter la collecte automatisée sur son service. La contourner suppose d'avoir identifié cette limite, donc d'avoir su qu'un seuil était franchi.
Cette conscience du franchissement change la qualification morale de l'acte, et parfois sa qualification juridique. Consulter une page accessible et neutraliser un dispositif destiné à empêcher son aspiration massive ne se situent pas au même niveau. Le premier geste relève de l'usage normal d'un service, le second d'une action délibérée contre la volonté explicite de son exploitant.
Pour une direction, le test pratique est simple : accepterait-on d'expliquer publiquement la méthode employée. Une collecte qui suppose de dissimuler son origine, de simuler un comportement humain et de répartir les requêtes pour ne pas être repérée échoue à ce test. Ce n'est pas un critère juridique, mais c'est un indicateur fiable de la zone dans laquelle on se trouve.
Contourner une protection suppose de l'avoir vue. Cette lucidité, plus que la nature des données recueillies, est ce qui distingue l'observation de l'intrusion.
L'organigramme reconstitué : valeur analytique et marge d'erreur
Un organigramme obtenu par classification automatique comporte trois sources d'erreur structurelles. La première est la couverture : tous les collaborateurs ne sont pas présents sur la plateforme, et les absents ne se répartissent pas au hasard entre fonctions, niveaux et pays. La seconde est la fraîcheur : un profil se met à jour avec retard, parfois jamais après un départ.
La troisième est l'inférence hiérarchique elle-même. Rattacher un intitulé à un niveau suppose une grille, et cette grille est bâtie sur des conventions moyennes qui ne correspondent à aucune organisation particulière. Deux entreprises comparables emploient des dénominations très différentes pour des fonctions identiques, ce qui produit des écarts systématiques et non des erreurs aléatoires compensables.
Ces limites n'annulent pas la valeur du produit, elles en fixent l'usage. Un organigramme reconstitué sert à repérer des mouvements, un renforcement d'une fonction, l'apparition d'une équipe sur une technologie, l'ouverture d'une implantation. Il ne sert pas à décrire une structure de décision. Le livrable honnête indique son taux de couverture estimé et la date de collecte, en évidence.
Doctrine : quatre critères pour situer une collecte
Le premier critère est l'échelle. Consulter cinquante profils dans une démarche d'analyse ciblée et en aspirer plusieurs milliers de façon systématique ne produisent ni le même objet ni le même risque. L'échelle transforme une consultation en constitution de base de données, avec les obligations correspondantes en matière de finalité, de conservation et d'information des personnes.
Le deuxième critère est la finalité déclarée et sa cohérence avec l'usage réel. Le troisième est le respect des mesures de protection : contourner un dispositif technique constitue une ligne nette, facile à objectiver et facile à interdire en interne. Le quatrième est la réversibilité, c'est-à-dire la capacité à supprimer les données collectées et à documenter cette suppression.
Ces quatre critères s'écrivent dans une charte interne et se contrôlent. Ils n'exigent aucune expertise juridique avancée pour être appliqués et ils protègent l'organisation mieux qu'une interdiction générale, toujours contournée en pratique. Sur le fond, ils reformulent une question ancienne : que ferait-on si la même méthode était employée contre soi, et à la même échelle.
Ce que l'automatisation ne remplace pas
La lecture d'un organigramme reconstitué demande une connaissance sectorielle que l'outil ne fournit pas. Savoir qu'un intitulé recouvre une fonction stratégique dans un secteur et une fonction d'exécution dans un autre, reconnaître un schéma d'organisation matricielle, identifier une filiale opérant sous une autre marque : ces compétences restent humaines et déterminent entièrement la valeur du résultat.
Le croisement avec d'autres sources reste également indispensable. Registres d'entreprises, dépôts de titres, offres d'emploi publiées, communications officielles et couverture presse permettent de valider ou d'infirmer une inférence. NewsCore (www.newscore.fr) couvre en continu des millions de sources et relie ces signaux dispersés à l'entité concernée, ce qui raccourcit le délai entre une évolution organisationnelle et sa détection.
Reste enfin la question de la décision. Un organigramme ne dit pas ce qu'il faut faire, et sa précision apparente encourage la surinterprétation. La discipline consiste à formuler explicitement l'hypothèse que la cartographie doit servir à confirmer ou à infirmer, avant même d'engager la collecte. Sans cette question préalable, le livrable impressionne, circule largement en interne et ne modifie aucune décision, ce qui est la définition même d'un travail de veille inutile.
Questions fréquentes
Collecter des profils professionnels publics est-il légal ?
Le caractère public d'une donnée personnelle ne suffit pas à autoriser sa réutilisation. La question porte sur la finalité du traitement, sa base légale, la durée de conservation et l'information des personnes concernées. S'y ajoute un second terrain, contractuel celui-là : les conditions d'utilisation des plateformes interdisent généralement la collecte automatisée, indépendamment de toute question de protection des données.
Pourquoi les fonctions anti-détection posent-elles un problème particulier ?
Parce qu'elles supposent l'existence d'une mesure de protection, donc la connaissance d'une limite posée par l'exploitant du service. Bright Coding indique que l'outil embarque de telles fonctions. Contourner délibérément un dispositif destiné à empêcher l'aspiration massive ne relève plus de l'usage normal d'un service accessible, et cette intention documentée pèse lourd en cas de contentieux.
Quelle confiance accorder à un organigramme reconstitué automatiquement ?
Une confiance relative, à condition d'en connaître les limites. Trois biais s'accumulent : une couverture incomplète et non aléatoire, des profils mis à jour avec retard, et une classification hiérarchique fondée sur des conventions moyennes. Le résultat sert à détecter des mouvements et des renforcements de fonctions, il ne décrit pas une structure de décision réelle.
Comment encadrer cette pratique dans une organisation ?
Par une charte fondée sur quatre critères contrôlables : l'échelle de la collecte, la cohérence entre finalité déclarée et usage réel, le respect strict des mesures de protection techniques, et la réversibilité documentée des données recueillies. Une règle explicite et applicable protège mieux qu'une interdiction générale, qui se contourne toujours en pratique et prive l'organisation de tout contrôle.