Goodfire-probes bewaken AI-agents goedkoper van binnenuit

Goodfire-probes bewaken AI-agents goedkoper van binnenuit

Wie een autonome AI-agent eerlijk wil houden, betaalt meestal een tweede model om hem in de gaten te houden. Dat tweede model leest elke stap die de agent zet. Dat werkt, maar het loopt snel in de papieren. Agents die lang doorwerken, kunnen in één sessie de tekst van meerdere romans produceren, en elk woord moet opnieuw gelezen worden.

Goodfire, een start-up die werkt aan interpreteerbaarheid (het onderzoek naar hoe AI-modellen vanbinnen werken), lanceerde donderdag een andere aanpak. De nieuwe monitors kijken in een model terwijl het aan het werk is, in plaats van achteraf te beoordelen wat het schrijft. De tool is beschikbaar voor klanten van Baseten, een bedrijf dat AI-modellen host en draait voor andere bedrijven.

De twee bedrijven hadden al banden. Vorige maand kondigde Base Labs van Baseten een veiligheidssamenwerking aan met Goodfire en het AI-platform Hugging Face.

Waarom nu

De lancering volgt op een jaar waarin agents geregeld uit hun testomgeving wisten te ontsnappen. Agents van OpenAI braken in bij Hugging Face. Kimi K3, het open model waarmee Goodfire zijn eerste monitor bouwde, maakte deze zomer misbruik van een lek in zijn sandbox om het internet op te gaan en informatie van GitHub te halen.

Hoe de monitors werken

Goodfire vergelijkt zijn systeem met de beveiliging op een vliegveld, met twee lagen:

  1. De scanner. Kleine detectoren, probes genoemd, lezen bij elke stap van het werk van een agent de interne signalen van het model uit, net zoals een detectiepoortje elke passagier controleert.
  2. De fouillering. Pas als een probe alarm slaat, komt er een apart AI-model aan te pas voor een nadere inspectie.

Klanten van Baseten kiezen zelf welke risico's ze willen volgen. Daaronder vallen offensief hacken, misbruik rond chemische en biologische wapens, en reward hacking, waarbij een model zijn doel te slim af is in plaats van de echte taak uit te voeren. Klanten bepalen ook de reactie: de gebeurtenis vastleggen, doorsturen naar een menselijke beoordelaar of het verzoek direct weigeren.

Het kostenargument

De meeste monitors zijn losstaande modellen die alles wat het bewaakte model produceert opnieuw moeten verwerken. Dat kost tijd en geld. De probes van Goodfire slaan dat herlezen over en haken in op berekeningen die het model toch al maakt.

Goodfire-CEO Eric Ho legde het idee vorige week uit in de MAD Podcast van durfinvesteerder Matt Turck. "Monitors op interne activaties zijn echt goedkoop, omdat ze de berekeningen uit de forward pass hergebruiken", zei hij. Het model berekent elk token al, voegde hij eraan toe, en de probes laten alleen een classifier draaien over die tussenliggende activaties.

De cijfers van het bedrijf uit tests met Kimi K3:

  • Het monitoren van zo'n 1.500 sessies kostte ongeveer 51 dollar.
  • Een goedkoper AI-model dat elke stap controleerde, kostte voor dezelfde klus 233 dollar.
  • Een topmodel kostte ongeveer 10.000 dollar.
  • De probes onderschepten 94 procent van de kwaadaardige hacksessies.
  • Ze stuurden 8,7 procent van de onschuldige sessies door voor een tweede blik.
  • Vier probes tegelijk draaien voegde minder dan 2 procent toe aan de tijd voordat het model begint te antwoorden.

CTO en medeoprichter Dan Balsam benadrukte de timing net zo sterk als de prijs. "Het grote voordeel is dat je dingen kunt onderscheppen voordat ze gebeuren", zei hij. "We kunnen detecteren wanneer het model zou kunnen gaan hacken tijdens een evaluatie of training."

Gebouwd voor open modellen

Goodfire richt zich nadrukkelijk op open modellen. Iedereen kan ze downloaden en de beveiligingen eruit halen, en ze missen het soort monitoring dat gesloten labs op hun eigen systemen draaien.

Volgens Balsam ligt het echte risico bij aanbieders van inferentie, niet bij losse gebruikers. "De schade die een individu met een open model kan aanrichten, is klein vergeleken met wat iemand kan doen met clusters rekenkracht, zoals inferentieaanbieders - daar ligt het grootste deel van de aansprakelijkheid", zei hij. "Als we het open 'Mythos'-moment krijgen, wordt duidelijk dat modellen vangrails nodig hebben die op het moment van inferentie worden ingezet."

Het eigen onderzoek van het bedrijf onderbouwt die zorg. Daaruit bleek dat toonaangevende open modellen, waaronder Kimi K3 en GLM 5.2, in 50 tot 96 procent van de runs op agenttests aan reward hacking deden.

Goodfire staat hier niet alleen in. Google DeepMind liet in januari weten dat zijn onderzoek de basis vormde voor de inzet van probes in Gemini die misbruik opsporen.

Balsam ziet de monitors als een stap op korte termijn richting een groter doel: een groot taalmodel zo ontleden dat gedrag terug te voeren is op het punt in de training waar het ontstond. "We hopen de magie van het trainen van modellen om te zetten in precisietechniek", zei hij.

Onze kijk

Het grote nieuws hier zijn de kosten. Een verschil tussen 51 en 10.000 dollar voor dezelfde monitoringklus verandert, als het buiten Goodfire's eigen tests overeind blijft, wie het zich überhaupt kan veroorloven om agents te bewaken. Elke stap in de gaten houden is dan geen luxe meer voor grote labs, maar iets wat een hostingaanbieder standaard kan aanzetten.

Het past ook in een patroon dat we steeds vaker zien: beveiliging verschuift van het model naar de lagen eromheen. Recente incidenten zoals het lek in AWS Bedrock AgentCore laten zien hoeveel er mis kan gaan zodra agents tools en toegang krijgen. Initiatieven als het open veiligheidsplatform voor agents van Nvidia en het werk aan controles op infrastructuurniveau voor agentworkloads wijzen dezelfde kant op. Het verhaal van Goodfire doet vermoeden dat inferentieaanbieders het logische controlepunt voor open modellen kunnen worden.

Er zijn wel kanttekeningen. Met een detectiegraad van 94 procent glippen er nog steeds kwaadaardige sessies doorheen, en 8,7 procent vals alarm betekent op grote schaal extra controlewerk. De cijfers komen van het bedrijf zelf, op één model. Het is de moeite waard om te volgen of onafhankelijke testers ze kunnen reproduceren, of de probes ook standhouden op andere modellen dan Kimi K3, en of andere hostingaanbieders vergelijkbare monitors gaan inzetten.