OpenAI stopt diefstal van redeneringen, Azure bleef lek

OpenAI stopt diefstal van redeneringen, Azure bleef lek

OpenAI zegt dat het een gecoordineerde poging heeft stilgelegd om de verborgen redeneringen van zijn modellen buit te maken. Onafhankelijke onderzoekers ontdekten echter dat dezelfde techniek daarna nog wekenlang werkte op Microsoft Azure. De zaak laat zien hoe een beveiligingsfix bij de bron voorbij kan gaan aan de cloudplatforms die dezelfde modellen doorverkopen.

Wat er volgens OpenAI gebeurde

In een blogpost beschrijft OpenAI wat het een campagne van "adversarial distillation" noemt. Bij distillatie train je het ene model op de uitvoer van een ander model. Het waardevolste doelwit is de volledige redeneerketen: de tussenstappen die een redeneermodel doorloopt voordat het antwoord geeft. Gebruikers zien normaal gesproken alleen het eindantwoord.

Volgens OpenAI kunnen die stappen informatie bevatten die bewust buiten het antwoord wordt gehouden, en kunnen ze een concurrent helpen de capaciteiten van een model na te bouwen.

De tijdlijn volgens OpenAI:

  • 1 juli: de activiteit begint op kleine schaal.
  • 24-25 juli: een piek van 16.000 verzoeken van meer dan 4.000 gebruikers, allemaal met een typisch extractiepatroon.
  • Verdere analyse: een netwerk van meer dan 15.000 accounts met verwante patronen.
  • 28 juli: volgens OpenAI is het netwerk volledig opgerold.

In een voetnoot staat dat het om pogingen tot extractie ging, niet noodzakelijk om geslaagde pogingen. OpenAI linkt een kerngroep aan mensen die verbonden zijn aan Moonshot AI, de maker van het taalmodel Kimi. Het bedrijf voegt eraan toe dat onduidelijk is of alle waargenomen actoren tot een en dezelfde bron te herleiden zijn. Anthropic meldde onlangs vergelijkbare pogingen door Chinese AI-bedrijven.

Hoe de truc werkte

Aanbieders geven redeneringen alleen als versleutelde datapakketten terug aan klanten, die deze bij vervolgverzoeken weer meesturen. De aanvallers kopieerden versleutelde redeneringen uit het ene gesprek en vroegen een model in een ander gesprek die te ontsleutelen en uit te schrijven.

Onderzoeker Joachim Schaeffer en zijn team hadden dit al beschreven in een paper. Omdat de pakketten gedeelde sleutels gebruiken, kunnen ze worden overgezet tussen sessies, tussen gebruikers en zelfs tussen verschillende modellen van dezelfde aanbieder. Een zwakker, goedkoper model uit dezelfde familie kan dan dienen als "ontsleutelingsorakel" en de redenering van het sterkere model woord voor woord uitdraaien.

OpenAI noemt de onderzoekers bij naam en zegt dat hun bevindingen hielpen om sneller tegenmaatregelen door te voeren. Daaronder vallen het blokkeren van frauduleuze accounts, strengere aanmeldingen, het dichten van het gat waardoor versleutelde redeneringen van andere gebruikers hergebruikt konden worden, en het controleren van gestreamde uitvoer, zodat die kan worden tegengehouden als ze redeneringen dreigt prijs te geven. OpenAI zegt zijn bevindingen te hebben gedeeld via het Frontier Model Forum en overheidskanalen.

Het gat in de cloud

Op dezelfde dag als de post van OpenAI publiceerden de onderzoekers een update. "We hebben weer redeneringen gestolen", schreef Schaeffer op X.

Bij een nieuwe test op 13 september zagen ze dat de aanval werd geblokkeerd op de eigen API's van OpenAI en Anthropic. Op Azure werkte hij tegen elk OpenAI-model dat ze probeerden, inclusief het nieuwe GPT-6 Astra, en tegen Anthropic-modellen tot en met Sonnet 5. Een enkele poging was genoeg om de redenering letterlijk naar buiten te halen. "Dezelfde modellen, maar verschillende beveiliging, afhankelijk van welk platform ze aanbiedt", aldus Schaeffer.

Er is ook een eenvoudigere route, die ontwikkelaar Can Bölük openbaar demonstreerde. Het model krijgt een virtueel kladblok als tool en de opdracht om zijn redenering daarin te noteren, waarna de gebruiker die kan lezen. Volgens de onderzoekers werkte dit bij elk OpenAI-model en bij Opus 4.8 en Sonnet 5. Alleen Opus 5, Fable 5 en Fable 5.1 gaven hun redenering niet prijs. De uitvoer leek volgens de onderzoekers sterk op de resultaten van de ontsleuteling en zou waarschijnlijk net zo bruikbaar zijn voor distillatie.

Ze noemen de fixes tot nu toe lapwerk en oppervlakkig. Veel ervan leunen op fragiele herkenning van specifieke verzoekpatronen, en sommige bereikten de cloudplatforms pas dagen later. GPT-6 Astra verscheen zonder die beveiliging op platforms van derden. Volgens de tijdlijn van de onderzoekers voegde OpenAI op 27 september beveiliging toe aan het Azure-endpoint. Bij Anthropic-modellen was de extractie op Azure vanaf 28 september niet meer te reproduceren.

Schaeffer stelt dat patches elk type aanval en elke cloud waarop een model draait moeten afdekken, anders kiezen aanvallers gewoon de zwakste route. De paper gaat nog verder: cloudaanbieders die geen gelijkwaardige beveiliging afdwingen, zouden helemaal geen redeneermodellen mogen aanbieden. Anders, schrijven de onderzoekers, kunnen open achterdeurtjes het mogelijk maken om exportbeperkingen op API-niveau te omzeilen. OpenAI is het ermee eens dat modellen die bij partners draaien dezelfde bescherming nodig hebben als de eigen diensten, en zegt dat het werk nog niet af is.

Het grotere plaatje

De belangrijkste les gaat over architectuur, niet over een enkele exploit. De beveiligingsgrens van een model is niet de API van het lab. Het is elk endpoint waarop het model draait. Als een aanbieder zijn eigen dienst dichttimmert maar een wederverkoper weken achterloopt, wordt het zwakkere endpoint de echte grens. Ontwikkelaars die via clouds als Azure toegang tot modellen kopen, moeten er niet van uitgaan dat ze dezelfde bescherming krijgen.

De zaak suggereert ook dat filters die zijn afgestemd op specifieke verzoekpatronen op zichzelf een zwakke verdediging zijn. De kladblokmethode had helemaal geen ontsleuteling nodig. Fixes die een bekend patroon blokkeren, sturen aanvallers mogelijk gewoon door naar het volgende.

Distillatie is een commerciele kwestie en steeds vaker ook een beleidskwestie. Door de koppeling die de onderzoekers met exportbeperkingen leggen, raakt het aan de bredere inspanningen van Chinese labs om onder hardwarebeperkingen krachtige modellen te bouwen, zoals te zien is aan de tools van Deepseek voor Huawei Ascend-chips. Het is de moeite waard om te volgen of cloudplatforms zich vastleggen op beveiliging op het niveau van de labs vanaf de lancering, of toezichthouders het voorstel van de onderzoekers oppakken, en of OpenAI's verwachting van geavanceerdere pogingen uitkomt naarmate modellen beter worden.