Comment fonctionne le filigrane de texte par IA : percer le secret de la détection de contenu synthétique
Comprendre le système de filigranes textuels d'Anthropic, qui repose sur des statistiques de sélection de mots plutôt que sur le masquage de données.
À l'ère de l'adoption massive de l'intelligence artificielle, la distinction des textes générés par IA est devenue cruciale, en particulier depuis que des entreprises comme Anthropic, créatrices de Claude, intègrent des filigranes lisibles par machine pour se conformer à l'EU AI Act et accroître la transparence.
Des analyses techniques et des sources open source révèlent que le filigrane de texte par IA (AI Text Watermarking) diffère fondamentalement de l'intégration de métadonnées ou de caractères spéciaux invisibles (comme les espaces Unicode).
Le principe repose sur l'introduction d'un « biais statistique » lors de la sélection des tokens (mots) par le modèle. À mesure que le texte est généré, une clé secrète influence le modèle pour qu'il privilégie certains synonymes, plutôt que de s'en tenir uniquement à la probabilité naturelle la plus élevée. Cela revient à graver une empreinte digitale statistique directement dans le contenu.
Cependant, cette technologie présente des avantages et des limites. Le filigrane persiste même après un copier-coller, mais sa précision dépend de la longueur du texte : un extrait trop court s'avère difficile à détecter. De plus, les signaux statistiques peuvent être altérés ou effacés en cas de modifications lourdes ou de paraphrases.
Cette technologie aide les utilisateurs à comprendre comment les plateformes vérifieront l'origine des contenus générés par IA, tout en soulignant ses limites techniques, notamment la vulnérabilité des filigranes face à la réécriture.