Anthropic annonce glisser une signature invisible dans le texte de Claude, mais comment ça marche ?

L'empreinte invisible de Claude

 
Et si l’on pouvait détecter, sans faille, quand un texte, un devoir, un article est en fait le résultat d’une génération par Claude ? Anthropic annonce l’intégration d’une empreinte invisible à toutes les réponses de Claude, mais comment cela fonctionne ?

« Lorsqu’un modèle Claude pris en charge génère du texte, il y intègre un filigrane imperceptible directement dans le texte lui-même » : c’est ainsi qu’Anthropic explique le changement de fonctionnement dans ses modèles d’IA depuis une mise à jour du 2 août 2026. L’entreprise y explique vouloir qu’un texte produit par son IA reste identifiable, même après avoir été copié, collé ou envoyé par mail. Un marquage invisible pour l’humain.

Depuis le 2 août 2026, l’article 50 de l’AI Act européen impose aux fournisseurs d’IA générative de rendre leurs contenus identifiables par un marquage lisible par une machine. Anthropic a signé le code de bonnes pratiques associé et applique le dispositif à ses nouveaux modèles – à l’échelle mondiale, pas seulement en Europe.

Comment glisse-t-on une marque dans un texte sans qu’aucun caractère bizarre n’apparaisse à l’écran ? C’est de la stéganographie.

Une signature que l’œil ne voit pas

Pour une image générée, l’idée est simple, le moteur peut y coller un filigrane numérique, ou watermark. Pour du texte, c’est plus compliqué. Selon sa documentation, Claude insère dans ses réponses un marqueur que rien ne trahit visuellement, mais qu’un outil sait retrouver.

Contrairement à une idée qui circule, Anthropic n’ajoute pas de caractères cachés entre les mots. Sa marque est tissée dans le texte lui-même : le modèle oriente très légèrement le choix des mots, sans que rien ne change à l’œil ni au sens. Il s’agit d’un filigrane statistique, qu’un test logiciel repère sur un texte assez long. Cela permet de rendre le filigrane résistant aux copier-coller et aux changements de mises en forme.

Concrètement, la signature ne s’ajoute pas au texte, c’est le texte lui-même, cachée dans la façon dont les mots ont été choisis.

Pour donner un exemple simple, la vraie recette d’Anthropic est sans doute bien plus complexe, c’est comme si l’on imposait à Claude « utiliser la lettre E tous les 25 caractères ». Il suffit pour une machine de compter les occurrences de la lettre E et repérer cet espace de 25 caractères pour comprendre qu’il s’agit d’un texte généré par Claude.

Des limites évidentes

En principe, ce système devrait donc permettre à un logiciel de détecter un texte généré par Claude : une publication sur les réseaux sociaux, un document Word, un mail ou encore un article de presse. Les plus vieux se souviendront peut-être du fond jaune laissé par les premières versions de Wikipedia après un copier-coller un peu rapide sur Word. C’est le même principe ici en quelque sorte, mais moins visible pour l’humain.

Reste que ce système a des failles plutôt évidentes. Tout d’abord, il y a les faux positifs. Dans notre exemple, si un humain rédige un texte et y place un E tous les 25 caractères par habitude, un logiciel pourrait confondre son texte avec un produit de Claude.

Surtout, s’il résiste à un copier-coller bête et méchant, il ne devrait pas résister à une reformulation, une traduction ou un remaniement en profondeur – des outils de contournement ont d’ailleurs été bricolés en quelques minutes.

Le dispositif attrape donc surtout l’utilisateur qui ne se méfie pas. Celui qui veut effacer la trace y arrive sans grand effort.. Il suffirait à l’utilisateur de demander à un autre modèle de reformuler le texte généré par Claude pour casser le schéma statistique.

Comme le détaille Numerama, cette empreinte pose aussi une vraie question de vie privée : votre correspondance se retrouve marquée à votre insu, sans que rien vous l’indique au moment de rédiger.


Les bons plans n’attendent pas : abonnez-vous à notre canal WhatsApp Frandroid Bons Plans ! (zéro spam, promis, juste de super bons plans).

Recherche IA boostée par
Perplexity