Détection, authentification, provenance : trois notions à ne pas confondre
Détecter un faux, authentifier une origine, documenter une provenance : trois opérations distinctes, trois coûts, trois limites. Repère de vocabulaire pour cadrer une décision.
À retenir
- La détection estime une probabilité après diffusion, elle n'établit jamais une origine.
- L'authentification lie un contenu à un émetteur identifié, elle ne dit rien de la véracité du propos.
- La provenance documente la chaîne des transformations subies par un fichier depuis sa création.
- Confondre les trois conduit à investir dans l'outil qui ne répond pas à la question posée.
Trois mots circulent dans les discussions sur les contenus manipulés, souvent employés l'un pour l'autre : détection, authentification, provenance. Ils désignent pourtant des opérations techniques distinctes, qui répondent à des questions différentes, coûtent des efforts différents et échouent pour des raisons différentes. La confusion n'est pas seulement lexicale : elle conduit régulièrement à financer un dispositif qui ne traite pas le problème rencontré.
Le déplacement en cours rend ce repère utile. Biometric Update rapporte que les gouvernements cessent de miser uniquement sur la détection des faux après diffusion et investissent dans des infrastructures d'authentification de l'origine et de l'intégrité des contenus. L'Union européenne impose le marquage des contenus générés par intelligence artificielle, la Californie renforce ses obligations de transparence, et la France légifère contre les fausses informations en période électorale.
Ce repère de vocabulaire prolonge les constats de terrain publiés par Le Fil de la Veille sur les contenus synthétiques et les analyses de méthode de l'Observatoire de l'Intelligence Économique. Il ne propose pas d'outil : il pose ce que chaque notion établit, ce qu'elle n'établit pas, et à quelle question de décision elle répond réellement.
Détection : ce que mesure un score de probabilité, et ce qu'il ne dit pas
La détection consiste à examiner un contenu isolé, sans information sur son origine, et à estimer la probabilité qu'il ait été généré ou modifié par une machine. Elle s'appuie sur des indices statistiques : artefacts de compression, incohérences d'éclairage, régularités spectrales dans l'audio, distributions de mots improbables dans le texte. Son produit est un score, jamais un verdict.
Cette nature probabiliste impose trois précautions. Un score élevé n'établit pas l'intention de tromper, un score faible n'établit pas l'authenticité, et la performance mesurée en laboratoire se dégrade sur des contenus recompressés, recadrés ou rediffusés plusieurs fois. Un détecteur entraîné sur des générateurs d'une génération donnée perd en fiabilité face aux suivants, ce qui rend l'avantage structurellement temporaire.
La détection reste néanmoins indispensable pour une raison simple : elle est la seule opération applicable à un contenu déjà en circulation, dont personne ne contrôle l'origine. Elle sert à trier, à prioriser, à décider ce qui mérite une vérification humaine approfondie. Elle ne sert pas à conclure, et un dispositif qui la traite comme une réponse finale se trompe de niveau.
Authentification : établir qu'un contenu vient bien de l'émetteur annoncé
L'authentification répond à une autre question : ce contenu a-t-il bien été publié par l'entité dont il porte le nom ? Elle ne s'intéresse ni au réalisme du contenu ni à la véracité du propos, mais au lien entre un fichier et un émetteur identifié. Techniquement, elle repose sur des signatures cryptographiques apposées à la source et vérifiables par le destinataire.
L'avantage est décisif : contrairement à la détection, l'authentification produit un résultat binaire et vérifiable, indépendant de l'évolution des générateurs. Une signature valide ou ne l'est pas. C'est cette propriété qui explique le déplacement décrit par Biometric Update, puisqu'une infrastructure d'authentification ne se périme pas au rythme des modèles génératifs.
Sa limite est tout aussi nette. L'authentification ne dit rien de la vérité de ce qui est affirmé : un communiqué mensonger signé par son auteur est parfaitement authentique. Elle ne couvre que les émetteurs qui ont adopté le dispositif, laissant sans réponse l'immense majorité des contenus. Et une signature absente ne prouve pas la falsification, elle indique seulement que rien n'est vérifiable.
Provenance : documenter la chaîne des transformations subies par un fichier
La provenance est la notion la plus ambitieuse des trois. Elle consiste à attacher au fichier un historique vérifiable : conditions de capture ou de génération, outils utilisés, modifications successives, recadrages, exports. Là où l'authentification établit un point d'origine, la provenance décrit un parcours, ce qui la rend beaucoup plus informative et beaucoup plus fragile.
Sa fragilité tient à la chaîne elle-même. Chaque intermédiaire qui recompresse, redimensionne ou réencode un fichier sans préserver les métadonnées rompt le fil. Une capture d'écran suffit à tout effacer. La provenance ne fonctionne donc qu'à la condition que l'ensemble des acteurs de la diffusion, appareils, logiciels d'édition, plateformes, coopèrent en préservant l'information.
C'est pourquoi la provenance relève d'une politique publique plutôt que d'un choix d'outil. Les obligations de marquage des contenus générés par intelligence artificielle décrites par Biometric Update relèvent de cette logique : imposer aux producteurs d'inscrire une information à la source, faute de quoi aucun vérificateur situé en aval ne dispose de la matière nécessaire.
Pourquoi la confusion des trois notions coûte cher en décision
L'erreur la plus fréquente consiste à acheter de la détection pour résoudre un problème d'authentification. Une organisation dont les dirigeants sont imités dans de fausses vidéos n'a pas besoin d'un score de probabilité sur des contenus qu'elle découvre après coup : elle a besoin que ses propres publications soient vérifiables, afin que l'absence de signature devienne en soi un signal pour ses interlocuteurs.
L'erreur symétrique consiste à attendre de la provenance qu'elle traite les contenus déjà en circulation. Aucune infrastructure de provenance ne documente rétrospectivement un fichier qui n'en portait pas la trace. Sur ce stock, seule la détection s'applique, avec ses limites, complétée par les méthodes classiques de vérification en sources ouvertes.
Une signature valide ne rend pas un propos vrai, elle rend seulement son auteur impossible à nier.
Comment les textes en préparation répartissent la charge de la preuve
Le mouvement décrit par Biometric Update opère un transfert : la charge se déplace du destinataire, jusqu'ici seul à devoir démasquer un faux, vers le producteur, désormais tenu de marquer ce qu'il génère. L'Union européenne impose ce marquage pour les contenus générés par intelligence artificielle, ce qui constitue le premier pas d'une infrastructure de provenance à grande échelle.
Les obligations de transparence renforcées en Californie relèvent de la même logique, appliquée aux plateformes et aux annonceurs plutôt qu'aux seuls modèles. La législation française contre les fausses informations en période électorale poursuit un objectif voisin par un autre chemin, celui de la responsabilité de la diffusion dans une fenêtre temporelle où la vitesse rend la vérification inopérante.
Pour une organisation, la conséquence pratique est un ordre de priorité. Dans un environnement où le marquage à la source devient obligatoire, l'investissement rentable porte d'abord sur ses propres publications, ensuite sur sa capacité de surveillance. NewsCore (www.newscore.fr) couvre en continu des millions de sources multilingues, détecte les reprises et les détournements dès leur apparition, et ramène chaque occurrence à sa source primaire traçable.
Quelle notion mobiliser selon la question effectivement posée
Si la question est de savoir quoi faire d'un contenu reçu sans contexte, la détection fournit un tri, et rien de plus. Elle oriente l'attention humaine, elle ne fonde pas une communication publique. Un démenti appuyé sur un seul score de détecteur est vulnérable à la première contre-expertise, et cette vulnérabilité se retourne durablement contre celui qui l'a produit.
Si la question est de protéger la parole officielle d'une organisation, l'authentification est la seule réponse structurelle. Elle suppose un travail préalable sur les canaux, une pédagogie auprès des destinataires et une constance dans l'usage : un dispositif appliqué à la moitié des publications ne rend pas l'autre moitié suspecte, il rend l'ensemble illisible.
Si la question est d'établir des faits dans une procédure ou une enquête, la provenance est la notion pertinente, complétée par la chaîne de garde documentée des éléments collectés. C'est aussi la plus exigeante, car elle impose de préserver les fichiers originaux, leurs empreintes et leurs métadonnées dès la collecte, avant tout traitement susceptible d'effacer l'information utile.
Questions fréquentes
Un détecteur de deepfake suffit-il à trancher un cas litigieux ?
Non, et le présenter ainsi expose à un retournement rapide. Un détecteur produit une probabilité dépendante du modèle générateur, de la qualité du fichier et du nombre de rediffusions subies. Il sert à prioriser une vérification humaine, à orienter une recherche d'origine et à documenter un faisceau d'indices, jamais à fonder seul une conclusion publique.
Quelle différence entre authentification et provenance en pratique ?
L'authentification établit un lien vérifiable entre un contenu et son émetteur au moment de la publication. La provenance décrit en outre ce qui est arrivé au fichier ensuite : recadrages, exports, réencodages. La première répond à la question de savoir qui parle, la seconde à celle de savoir si ce qui circule correspond encore à ce qui a été publié.
Que faire des contenus antérieurs aux obligations de marquage ?
Les traiter avec les méthodes de vérification en sources ouvertes, qui restent la seule approche applicable au stock existant. Recherche d'antériorité de l'image, recoupement géographique et météorologique, identification de la première occurrence datée, comparaison avec des sources primaires indépendantes : ces gestes ne dépendent d'aucune infrastructure et ne se périment pas avec les générateurs.
Par quoi commencer avec des moyens limités ?
Par ses propres canaux. Recenser les canaux officiels, les rendre identifiables sans ambiguïté, publier la liste et signer ce qui peut l'être coûte peu et produit un effet immédiat : les interlocuteurs disposent d'un point de comparaison stable. La capacité de détection et la surveillance des reprises viennent ensuite, une fois cette base établie.