OpenAI textGrain: Wasserzeichen für ChatGPT-Texte in der EU

OpenAI textGrain: Wasserzeichen für ChatGPT-Texte in der EU

OpenAI wird in Texten, die ChatGPT und Codex für Nutzer in der Europäischen Union erzeugen, künftig ein maschinenlesbares Signal verstecken. Außerhalb des Chatbots geht das Unternehmen lockerer vor. Entwickler, die die API nutzen, können weltweit selbst entscheiden, ob sie die Funktion einschalten. Damit schlägt OpenAI einen anderen Weg ein als Anthropic, das Claude überall mit Wasserzeichen versieht.

Warum die EU der Auslöser ist

Berichten zufolge verlangt der EU AI Act, das Rahmengesetz der Staatengemeinschaft für künstliche Intelligenz, dass Anbieter KI-generierte Texte maschinenlesbar kennzeichnen. OpenAI antwortet darauf mit einem System namens textGrain. Es fügt weder sichtbare Hinweise noch Metadaten hinzu. Stattdessen beeinflusst es die Wortwahl des Modells so, dass sich ein statistisches Muster in der Ausgabe festsetzt. Für Leser ist es unsichtbar, ein Detektor kann aber gezielt danach suchen.

Der Ansatz ähnelt dem SynthID-Wasserzeichen von Claude, das auf Googles Open-Source-Technologie aufbaut. Laut OpenAI hat textGrain in eigenen Tests genauso gut oder besser abgeschnitten als konkurrierende Verfahren, darunter Googles SynthID für Text. Das Unternehmen will textGrain außerdem als Open Source veröffentlichen, damit andere darauf aufbauen können.

Die Einführung erfolgt in drei Schritten:

  1. ChatGPT und Codex in der EU: Die Wasserzeichen werden in den kommenden Wochen aktiviert.
  2. API weltweit: Die Wasserzeichen sind optional, nicht verpflichtend.
  3. Cloud-Partner: Die API-Wasserzeichen kommen in den nächsten Wochen auch auf Plattformen wie Microsoft Azure.

Anthropics Wasserzeichen für Claude gilt weltweit, unabhängig davon, wie Menschen auf die Modelle zugreifen. Das optionale API-Modell von OpenAI ist der deutlichste Unterschied zwischen beiden.

Was die Erkennungsraten zeigen

OpenAI hat Zahlen zur Erkennung vorgelegt, und die hängen stark davon ab, wie lang ein Text ist und worum es darin geht. Bei einer angestrebten Falsch-Positiv-Rate von 1 Prozent erkannte der Detektor das Wasserzeichen in etwa 95 Prozent der Textpassagen zum Thema Psychologie mit 400 Token. Bei 200 Token sank die Quote auf rund 80 Prozent.

Bei Mathematik-Inhalten fielen die Ergebnisse laut OpenAI "deutlich" schlechter aus. Der Grund ist einfach. Gibt es weniger gültige Formulierungen für eine Aussage, hat das Modell weniger Spielraum bei der Wortwahl, und das Signal wird schwächer. Längere Passagen könnten dem Detektor mehr Material liefern, die Ergebnisse dürften aber trotzdem je nach Thema schwanken. Daten, die das belegen, hat OpenAI nicht vorgelegt.

Die größere Schwachstelle ist die Nachbearbeitung. Nach OpenAIs Zahlen sinkt die Erkennungsrate von etwa 92 auf 66 Prozent, wenn man in einer Passage mit 400 Token nur 10 Prozent der Wörter durch Synonyme ersetzt. Wird ein Viertel der Wörter ausgetauscht, fällt sie auf 17 Prozent. In der Praxis reicht also schon eine leichte Überarbeitung, um das Wasserzeichen auszuhebeln.

Für OpenAI muss diese Anfälligkeit nicht nur schlecht sein. Wäre das Wasserzeichen viel schwerer zu entfernen, könnten Nutzer, die ihren ChatGPT-Einsatz für sich behalten wollen, stattdessen zu Open-Weight-Modellen abwandern.

Anthropic hat keine Erkennungsraten für das Wasserzeichen von Claude veröffentlicht, erklärt aber, sein System halte Bearbeitungen gut stand. OpenAI hat einen technischen Bericht vorgelegt, der den Aufbau von textGrain ausführlich beschreibt.

Qualität und was ein Wasserzeichen nicht beweist

Nach Angaben von OpenAI verschlechtern die Wasserzeichen die Ausgabe nicht. Das Unternehmen verweist auf Tests mit seinem Spitzenmodell Astra, bei denen sich in acht Benchmarks, darunter GPQA Diamond, BrowseComp und DeepSWE, mit und ohne die Funktion keine nennenswerten Unterschiede zeigten. Diese Benchmarks messen allerdings logisches Denken, Websuche und Programmieren, nicht Fließtext. Ob sich die Qualität des Schreibens verändert, klären sie nicht. Dieselbe Frage haben Kritiker auch beim Wasserzeichen von Claude aufgeworfen.

OpenAI ist zudem vorsichtig, was ein positives Ergebnis bedeutet. Ein erkanntes Wasserzeichen sagt nichts darüber aus, wie stark ein Mensch den Text bearbeitet oder dazu beigetragen hat. Es belegt keine Urheberschaft, weist keine Verantwortung zu, identifiziert keinen Nutzer und bestätigt nicht, dass der Inhalt stimmt. Umgekehrt gilt das ebenso: Fehlt ein Wasserzeichen, beweist das nicht, dass ein Mensch den Text geschrieben hat. Er kann zu kurz, bearbeitet oder übersetzt sein oder von einem Modell stammen, das der Detektor nicht abdeckt.

Ein Detektor mit Zugangsbeschränkung

Vorerst ist der Detektor nicht öffentlich. Ausgewählte Forscher und spezialisierte Organisationen können sich über ein Formular bewerben, und OpenAI entscheidet im Einzelfall auf Grundlage des EU-Verhaltenskodex, der freiwilligen Leitlinien zum AI Act. Anthropic handhabt seine Erkennungs-API ähnlich.

Das Werkzeug liefert nur eine einzige Antwort: ob ein OpenAI-Wasserzeichen gefunden wurde. Nutzer, Prompts oder Unterhaltungen gibt es nicht preis.

Als Grund für die Beschränkung nennt OpenAI, dass der Detektor unmarkierte Texte fälschlich anschlagen und echte Wasserzeichen übersehen kann. Man werde den Zugang erweitern, "wenn wir überzeugt sind, dass sich die Ergebnisse verantwortungsvoll interpretieren lassen", einen Zeitplan nennt das Unternehmen aber nicht. Die bestehenden Herkunftswerkzeuge für Bilder und Audio, darunter openai.com/verify und die Content Provenance API, bleiben öffentlich zugänglich.

Unsere Einschätzung

Das Muster ist eine Regelbefolgung, die von der Geografie abhängt. OpenAI setzt Wasserzeichen dort ein, wo die Regulierung es verlangt, und überlässt die Entscheidung anderswo den Entwicklern. Das spricht dafür, dass die Regulierung und nicht die Produktphilosophie die Mindeststandards für die Herkunftskennzeichnung von Texten festlegt. Für Leser, die auf der API aufbauen, heißt das ganz praktisch: Außerhalb der EU sind Wasserzeichen jetzt eine Einstellung, über die Sie selbst entscheiden.

Auch bei den Zahlen ist Vorsicht angebracht. Ein Signal, dessen Erkennungsrate auf 17 Prozent sinkt, sobald ein Viertel der Wörter ersetzt wird, ist ein schwaches Werkzeug für Lehrkräfte, Redakteure oder Plattformen, die KI-Texte aufspüren wollen. OpenAI sagt selbst, dass ein Ergebnis in beide Richtungen wenig beweist. Wer solche Detektoren wie Lügendetektoren behandelt, wird wahrscheinlich Fehler machen.

Es lohnt sich zu beobachten, ob die Open-Source-Veröffentlichung es Außenstehenden ermöglicht, textGrain unabhängig gegen SynthID zu testen, und ob Anthropic eigene Erkennungsraten veröffentlicht. Auch der Druck von Aufsichtsbehörden auf KI-Labore, etwa durch die FTC-Untersuchung gegen OpenAI und Anthropic, könnte andere Rechtsräume zu Kennzeichnungsregeln nach EU-Vorbild bewegen. Kommt es dazu, dürfte die heutige Opt-in-Voreinstellung nicht von Dauer sein.