OpenAI stoppt Diebstahl von Denkschritten, Azure blieb offen
OpenAI hat nach eigenen Angaben einen koordinierten Versuch unterbunden, die verborgenen Denkschritte seiner Modelle abzugreifen. Unabhängige Forscher stellten jedoch fest, dass dieselbe Technik auf Microsoft Azure noch wochenlang danach funktionierte. Der Fall zeigt, wie eine Sicherheitskorrektur an der Quelle an den Cloud-Plattformen vorbeigehen kann, die dieselben Modelle weiterverkaufen.
Was laut OpenAI passiert ist
In einem Blogbeitrag beschreibt OpenAI eine Kampagne, die das Unternehmen als "adversarial distillation" bezeichnet, also als feindselige Destillation. Destillation bedeutet, ein Modell mit den Ausgaben eines anderen Modells zu trainieren. Das wertvollste Ziel ist dabei die vollständige Gedankenkette: die Zwischenschritte, die ein Reasoning-Modell durchläuft, bevor es antwortet. Nutzer sehen normalerweise nur die endgültige Antwort.
Laut OpenAI können diese Schritte Informationen enthalten, die bewusst aus der Antwort herausgehalten werden, und einem Konkurrenten dabei helfen, die Fähigkeiten eines Modells nachzubauen.
Der zeitliche Ablauf nach Angaben von OpenAI:
- 1. Juli: Die Aktivität beginnt in geringem Umfang.
- 24.-25. Juli: Ein sprunghafter Anstieg auf 16.000 Anfragen von mehr als 4.000 Nutzern, alle mit einem typischen Extraktionsmuster.
- Weitere Analyse: Ein Netzwerk aus mehr als 15.000 Konten mit verwandten Mustern.
- 28. Juli: OpenAI zufolge wurde das Netzwerk vollständig abgeschaltet.
Eine Fußnote stellt klar, dass es sich um Extraktionsversuche handelte, nicht zwingend um erfolgreiche. OpenAI ordnet eine Kerngruppe Personen zu, die mit Moonshot AI in Verbindung stehen, dem Hersteller des Sprachmodells Kimi. Unklar sei allerdings, ob alle beobachteten Akteure auf eine einzige Quelle zurückgehen. Anthropic hatte kürzlich über ähnliche Versuche chinesischer KI-Unternehmen berichtet.
Wie der Trick funktionierte
Die Anbieter geben Denkschritte an Kunden nur als verschlüsselte Datenpakete heraus, die die Kunden bei Folgeanfragen zurückschicken. Die Angreifer kopierten verschlüsselte Denkschritte aus einer Unterhaltung und baten ein Modell in einer separaten Unterhaltung, diese zu entschlüsseln und auszuschreiben.
Der Forscher Joachim Schaeffer und sein Team hatten das bereits in einem Paper beschrieben. Weil die Pakete gemeinsame Schlüssel verwenden, lassen sie sich zwischen Sitzungen, zwischen Nutzern und sogar zwischen verschiedenen Modellen desselben Anbieters übertragen. Ein schwächeres, günstigeres Modell aus derselben Familie kann dann als "Entschlüsselungsorakel" dienen und die Denkschritte des stärkeren Modells Wort für Wort ausgeben.
OpenAI nennt die Forscher namentlich und erklärt, ihre Erkenntnisse hätten geholfen, Gegenmaßnahmen schneller umzusetzen. Dazu zählen das Sperren betrügerischer Konten, strengere Registrierungen, das Schließen der Lücke, die die Wiederverwendung verschlüsselter Denkschritte anderer Nutzer ermöglichte, sowie die Prüfung gestreamter Ausgaben, damit diese zurückgehalten werden können, falls sie Denkschritte preisgeben könnten. OpenAI gibt an, seine Erkenntnisse über das Frontier Model Forum und staatliche Kanäle geteilt zu haben.
Die Lücke in der Cloud
Am selben Tag wie OpenAIs Beitrag veröffentlichten die Forscher ein Update. "Wir haben die Denkschritte gestohlen. Schon wieder", schrieb Schaeffer auf X.
Bei erneuten Tests am 13. September stellten sie fest, dass der Angriff auf den eigenen APIs von OpenAI und Anthropic blockiert wurde. Auf Azure funktionierte er bei jedem OpenAI-Modell, das sie ausprobierten, einschließlich des neuen GPT-6 Astra, sowie bei Anthropic-Modellen bis hin zu Sonnet 5. Ein einziger Versuch reichte, um die Denkschritte wortgetreu herauszuholen. "Dieselben Modelle, aber unterschiedlicher Schutz, je nachdem, welche Plattform sie bereitstellt", sagte Schaeffer.
Es gibt auch einen einfacheren Weg, den der Entwickler Can Bölük öffentlich vorgeführt hat. Das Modell erhält einen virtuellen Notizblock als Werkzeug und wird angewiesen, seine Denkschritte dort aufzuschreiben, wo der Nutzer sie anschließend lesen kann. Laut den Forschern funktionierte das bei jedem OpenAI-Modell sowie bei Opus 4.8 und Sonnet 5. Nur Opus 5, Fable 5 und Fable 5.1 gaben ihre Denkschritte nicht preis. Den Forschern zufolge ähnelte die Ausgabe stark den Ergebnissen der Entschlüsselung und dürfte für die Destillation ebenso nützlich sein.
Sie bezeichnen die bisherigen Korrekturen als Flickwerk und oberflächlich. Viele beruhen auf einem anfälligen Abgleich bestimmter Anfragemuster, und manche erreichten die Cloud-Plattformen erst Tage später. GPT-6 Astra startete auf Plattformen von Drittanbietern ohne die Schutzmaßnahmen. Nach der Zeitleiste der Forscher ergänzte OpenAI am 27. September Sicherungen für den Azure-Endpunkt. Bei Anthropic-Modellen ließ sich die Extraktion auf Azure ab dem 28. September nicht mehr reproduzieren.
Schaeffer argumentiert, dass Patches jede Angriffsart und jede Cloud abdecken müssen, auf der ein Modell läuft, sonst wählen Angreifer den schwächsten Weg. Das Paper geht noch weiter: Cloud-Anbieter, die keine gleichwertigen Schutzmaßnahmen durchsetzen, sollten Reasoning-Modelle überhaupt nicht anbieten dürfen. Andernfalls, schreiben die Forscher, könnten offene Hintertüren es ermöglichen, Exportkontrollen auf API-Ebene zu umgehen. OpenAI stimmt zu, dass von Partnern gehostete Modelle denselben Schutz brauchen wie die eigenen Dienste, und erklärt, die Arbeit sei noch nicht abgeschlossen.
Das große Ganze
Die wichtigste Lehre betrifft die Architektur, nicht eine einzelne Schwachstelle. Die Sicherheitsgrenze eines Modells ist nicht die API des Labors. Sie umfasst jeden Endpunkt, an dem das Modell läuft. Wenn ein Anbieter seinen eigenen Dienst absichert, ein Wiederverkäufer aber wochenlang hinterherhinkt, wird der schwächere Endpunkt zur tatsächlichen Grenze. Entwickler, die Modellzugang über Clouds wie Azure einkaufen, sollten nicht davon ausgehen, dass sie identischen Schutz erhalten.
Der Fall legt außerdem nahe, dass Filter, die auf bestimmte Anfragemuster zugeschnitten sind, allein eine schwache Verteidigung sind. Die Notizblock-Methode kam ganz ohne Entschlüsselung aus. Korrekturen, die ein bekanntes Muster blockieren, treiben Angreifer womöglich einfach zum nächsten.
Destillation ist ein wirtschaftliches Thema und zunehmend auch ein politisches. Die Verbindung, die die Forscher zu Exportkontrollen ziehen, knüpft an die breiteren Bemühungen chinesischer Labore an, trotz Hardware-Beschränkungen leistungsfähige Modelle zu bauen, wie sich etwa an Deepseeks Werkzeugen für Huaweis Ascend-Chips zeigt. Es lohnt sich zu beobachten, ob sich Cloud-Plattformen verpflichten, schon zum Start Schutzmaßnahmen auf dem Niveau der Labore zu bieten, ob Regulierungsbehörden den Vorschlag der Forscher aufgreifen und ob sich OpenAIs Erwartung immer ausgefeilterer Versuche bewahrheitet, je besser die Modelle werden.
