OpenAI textGrain: watermerk in ChatGPT-tekst in de EU

OpenAI textGrain: watermerk in ChatGPT-tekst in de EU

OpenAI gaat een machineleesbaar signaal verstoppen in tekst die ChatGPT en Codex maken voor gebruikers in de Europese Unie. Buiten de chatbot is de aanpak vrijblijvender. Ontwikkelaars die de API gebruiken, kunnen overal ter wereld zelf kiezen of ze het aanzetten. Daarmee slaat OpenAI een andere weg in dan Anthropic, dat Claude overal van een watermerk voorziet.

Waarom de EU de aanleiding is

Volgens berichten verplicht de EU AI Act, de Europese kaderwet voor kunstmatige intelligentie, aanbieders om door AI gemaakte tekst zo te markeren dat machines dat kunnen lezen. OpenAI antwoordt daarop met een systeem dat textGrain heet. Het voegt geen zichtbare labels of metadata toe. In plaats daarvan stuurt het de woordkeuze van het model subtiel bij, zodat er een statistisch patroon in de uitvoer komt. Een lezer ziet het niet, maar een detector kan ernaar zoeken.

Het idee lijkt sterk op het SynthID-watermerk van Claude, dat gebouwd is op opensourcetechnologie van Google. Volgens OpenAI presteerde textGrain in eigen tests even goed als of beter dan concurrerende methoden, waaronder Googles SynthID voor tekst. Het bedrijf wil textGrain ook als open source uitbrengen, zodat anderen erop kunnen voortbouwen.

De uitrol bestaat uit drie delen:

  1. ChatGPT en Codex in de EU: het watermerk wordt de komende weken ingeschakeld.
  2. API wereldwijd: het watermerk is optioneel, niet verplicht.
  3. Cloudpartners: het API-watermerk komt de komende weken ook naar platforms zoals Microsoft Azure.

Bij Anthropic geldt het watermerk voor Claude wereldwijd, ongeacht hoe mensen de modellen gebruiken. Het optionele API-model van OpenAI is het duidelijkste verschil tussen de twee.

Wat de detectiecijfers laten zien

OpenAI deelde detectiecijfers, en die hangen sterk af van de lengte van de tekst en het onderwerp. Met de detector afgesteld op een beoogd percentage vals-positieven van 1 procent, werd het watermerk gevonden in ongeveer 95 procent van de passages van 400 tokens over psychologie. Bij 200 tokens zakte dat naar zo'n 80 procent.

Wiskundige inhoud scoorde volgens OpenAI "aanzienlijk" slechter. De reden is simpel. Als er minder geldige manieren zijn om iets te formuleren, heeft het model minder ruimte om met woordkeuze te variëren, en is het signaal dus zwakker. Langere passages kunnen de detector meer houvast geven, maar de resultaten kunnen nog steeds per onderwerp verschillen. OpenAI heeft geen gegevens gegeven om dat te onderbouwen.

Bewerken is de grootste zwakke plek. Volgens de cijfers van OpenAI daalt de detectie van ongeveer 92 naar 66 procent als je in een passage van 400 tokens slechts 10 procent van de woorden door synoniemen vervangt. Vervang een kwart van de woorden en de detectie zakt naar 17 procent. In de praktijk is een lichte herschrijving genoeg om het te omzeilen.

Die kwetsbaarheid is voor OpenAI misschien niet alleen maar slecht. Als het watermerk veel moeilijker te verwijderen was, zouden gebruikers die hun ChatGPT-gebruik privé willen houden kunnen overstappen op open-weight-modellen.

Anthropic heeft geen detectiepercentages voor het watermerk van Claude vrijgegeven, al zegt het bedrijf dat zijn systeem goed bestand is tegen bewerkingen. OpenAI heeft een technisch rapport gepubliceerd dat uitgebreid ingaat op het ontwerp van textGrain.

Kwaliteit, en wat een watermerk niet bewijst

OpenAI zegt dat het watermerk de uitvoer niet slechter maakt. Het wijst op tests met zijn frontiermodel Astra, die met de functie aan of uit geen significante verschillen lieten zien op acht benchmarks, waaronder GPQA Diamond, BrowseComp en DeepSWE. Die benchmarks meten echter redeneren, browsen en programmeren, geen proza. Ze geven geen uitsluitsel over de vraag of de schrijfkwaliteit verandert. Critici hebben dezelfde vraag gesteld over het watermerk van Claude.

OpenAI is ook voorzichtig met wat een positief resultaat betekent. Een gevonden watermerk zegt niets over hoeveel een mens aan de tekst heeft bewerkt of bijgedragen. Het stelt geen eigendom vast, wijst geen verantwoordelijkheid toe, identificeert geen gebruiker en bevestigt niet dat de inhoud klopt. Andersom geldt hetzelfde: geen watermerk bewijst niet dat een mens de tekst schreef. De tekst kan te kort zijn, bewerkt, vertaald of gemaakt door een model dat de detector niet dekt.

Een afgeschermde detector

Voorlopig is de detector niet openbaar. Geselecteerde onderzoekers en gespecialiseerde organisaties kunnen zich via een formulier aanmelden, en OpenAI beslist per geval op basis van de Code of Practice van de EU, de vrijwillige richtlijnen die bij de AI Act horen. Anthropic gaat op vergelijkbare wijze om met zijn detectie-API.

De tool geeft maar één antwoord: of er een watermerk van OpenAI is gevonden. Gebruikers, prompts of gesprekken worden niet onthuld.

Als reden voor de beperking noemt OpenAI dat de detector tekst zonder watermerk ten onrechte kan aanmerken en echte watermerken kan missen. Het bedrijf zegt de toegang te verruimen "zodra we denken dat de resultaten verantwoord kunnen worden geïnterpreteerd", maar noemt geen tijdpad. De bestaande herkomsttools voor beeld en audio, waaronder openai.com/verify en de Content Provenance API, blijven openbaar beschikbaar.

Onze analyse

Het patroon hier is naleving die afhangt van geografie. OpenAI zet een watermerk waar regelgeving dat eist en laat de keuze elders aan ontwikkelaars. Dat wijst erop dat regelgeving, en niet de productvisie, de ondergrens bepaalt voor de herkomst van tekst. Voor lezers die op de API bouwen, komt het in de praktijk hierop neer: buiten de EU is het watermerk nu een instelling waar je zelf over gaat.

Ook de cijfers verdienen voorzichtigheid. Een signaal dat na het vervangen van een kwart van de woorden nog maar in 17 procent van de gevallen wordt gevonden, is een zwak middel voor docenten, redacteuren of platforms die AI-tekst willen opsporen. OpenAI zegt zelf dat een resultaat hoe dan ook weinig bewijst. Wie deze detectoren als leugendetector gebruikt, gaat waarschijnlijk de mist in.

Het is de moeite waard om te volgen of de opensourcerelease buitenstaanders in staat stelt textGrain onafhankelijk te vergelijken met SynthID, en of Anthropic eigen detectiepercentages publiceert. Druk van toezichthouders op AI-labs, zoals het FTC-onderzoek naar OpenAI en Anthropic, kan ook andere rechtsgebieden richting labelregels naar Europees model duwen. Als dat gebeurt, blijft de huidige optionele standaard misschien niet lang bestaan.