OpenAI textGrain : les textes de ChatGPT filigranés dans l'UE

OpenAI textGrain : les textes de ChatGPT filigranés dans l'UE

OpenAI va commencer à dissimuler un signal lisible par les machines dans les textes produits par ChatGPT et Codex pour les utilisateurs de l'Union européenne. En dehors du chatbot, la démarche est plus souple. Les développeurs qui utilisent l'API, où qu'ils soient dans le monde, peuvent choisir de l'activer ou non. OpenAI prend ainsi un chemin différent de celui d'Anthropic, qui applique le filigrane à Claude partout.

Pourquoi l'UE est le déclencheur

Selon plusieurs sources, l'AI Act, la loi-cadre européenne sur l'intelligence artificielle, oblige les fournisseurs à marquer les textes générés par IA de manière lisible par une machine. La réponse d'OpenAI s'appelle textGrain. Le système n'ajoute ni étiquette visible ni métadonnées. Il oriente légèrement le choix des mots du modèle afin qu'un motif statistique se loge dans le texte. Un lecteur ne peut pas le voir, mais un détecteur peut le rechercher.

Le principe est proche du filigrane SynthID de Claude, qui repose sur la technologie open source de Google. OpenAI affirme que textGrain a fait aussi bien, voire mieux, que les méthodes concurrentes lors de ses propres tests, y compris SynthID de Google pour le texte. L'entreprise prévoit aussi de publier textGrain en open source pour que d'autres puissent s'en servir.

Le déploiement se fait en trois volets :

  1. ChatGPT et Codex dans l'UE : le filigrane sera activé dans les semaines à venir.
  2. API dans le monde entier : le filigrane est optionnel, pas obligatoire.
  3. Partenaires cloud : le filigrane de l'API arrivera aussi dans les prochaines semaines sur des plateformes comme Microsoft Azure.

Chez Anthropic, le filigrane de Claude s'applique dans le monde entier, quelle que soit la manière dont on accède à ses modèles. Le caractère optionnel de l'API d'OpenAI est la différence la plus nette entre les deux.

Ce que montrent les chiffres de détection

OpenAI a communiqué des chiffres de détection, qui dépendent fortement de la longueur du texte et de son sujet. Avec un détecteur réglé sur un taux cible de faux positifs de 1 %, le filigrane a été repéré dans environ 95 % des passages de 400 tokens portant sur la psychologie. À 200 tokens, le taux tombe à environ 80 %.

Les contenus mathématiques s'en sortent "nettement" moins bien, selon OpenAI. La raison est simple. Quand il existe moins de façons valables de formuler quelque chose, le modèle a moins de latitude pour varier ses mots, et le signal s'affaiblit. Des passages plus longs pourraient donner davantage de matière au détecteur, mais les résultats risquent de varier selon le sujet. OpenAI n'a fourni aucune donnée pour l'étayer.

La retouche est le vrai point faible. D'après les chiffres d'OpenAI, remplacer seulement 10 % des mots par des synonymes dans un passage de 400 tokens fait chuter la détection d'environ 92 % à 66 %. Remplacez un quart des mots, et elle tombe à 17 %. En pratique, une légère réécriture suffit à le neutraliser.

Cette fragilité n'est peut-être pas si gênante pour OpenAI. Si son filigrane était beaucoup plus difficile à effacer, les utilisateurs qui tiennent à garder leur usage de ChatGPT discret pourraient se tourner vers des modèles à poids ouverts.

Anthropic n'a pas publié de taux de détection pour le filigrane de Claude, mais affirme que son système résiste bien aux modifications. OpenAI a publié un rapport technique qui détaille la conception de textGrain.

La qualité, et ce qu'un filigrane ne prouve pas

OpenAI assure que le filigrane ne dégrade pas les réponses. L'entreprise s'appuie sur des tests de son modèle de pointe Astra, qui n'ont montré aucune différence significative avec ou sans la fonction sur huit benchmarks, dont GPQA Diamond, BrowseComp et DeepSWE. Ces benchmarks mesurent toutefois le raisonnement, la navigation web et le code, pas la prose. Ils ne permettent pas de dire si la qualité d'écriture change. Les critiques ont soulevé la même question à propos du filigrane de Claude.

OpenAI reste aussi prudente sur la portée d'un résultat positif. Un filigrane détecté ne dit rien de la part de retouche ou de contribution humaine dans le texte. Il n'établit pas la propriété, n'attribue aucune responsabilité, n'identifie pas un utilisateur et ne garantit pas que le contenu est exact. L'inverse vaut aussi : l'absence de filigrane ne prouve pas qu'un humain a écrit le texte. Celui-ci peut être trop court, retouché, traduit ou produit par un modèle que le détecteur ne couvre pas.

Un détecteur sous contrôle

Pour l'instant, le détecteur n'est pas public. Des chercheurs et des organisations spécialisées sélectionnés peuvent postuler via un formulaire, et OpenAI tranchera au cas par cas dans le cadre du Code de bonnes pratiques de l'UE, les lignes directrices volontaires associées à l'AI Act. Anthropic gère son API de détection de façon similaire.

L'outil ne renvoie qu'une seule réponse : un filigrane OpenAI a-t-il été trouvé ou non. Il ne révèle ni les utilisateurs, ni les prompts, ni les conversations.

OpenAI justifie cette restriction par le fait que le détecteur peut signaler à tort un texte non marqué et passer à côté de vrais filigranes. L'entreprise dit qu'elle élargira l'accès "lorsque nous estimerons que les résultats peuvent être interprétés de manière responsable", sans donner de calendrier. Ses outils de traçabilité existants pour les images et l'audio, dont openai.com/verify et la Content Provenance API, restent accessibles au public.

Notre analyse

On voit ici une conformité dessinée par la géographie. OpenAI applique le filigrane là où la réglementation l'exige et laisse le choix aux développeurs ailleurs. Cela laisse penser que c'est la réglementation, et non une philosophie produit, qui fixe le niveau minimal de traçabilité des textes. Pour les lecteurs qui développent sur l'API, le point concret est le suivant : hors de l'UE, le filigrane est désormais un réglage qui vous appartient.

Les chiffres appellent aussi à la prudence. Un signal dont la détection tombe à 17 % après le remplacement d'un quart des mots est un outil bien faible pour les enseignants, les éditeurs ou les plateformes qui espèrent repérer les textes d'IA. OpenAI elle-même reconnaît qu'un résultat ne prouve pas grand-chose, dans un sens comme dans l'autre. Quiconque traite ces détecteurs comme des détecteurs de mensonges risque de se tromper.

Il faudra voir si la publication en open source permettra à des tiers de comparer textGrain à SynthID de façon indépendante, et si Anthropic publiera ses propres taux de détection. La pression des régulateurs sur les laboratoires d'IA, comme l'enquête de la FTC visant OpenAI et Anthropic, pourrait aussi pousser d'autres juridictions vers des règles d'étiquetage à l'européenne. Si c'est le cas, l'option par défaut actuelle pourrait ne pas durer.