Goodfire überwacht KI-Agenten von innen und senkt Kosten
Wer einen autonomen KI-Agenten im Zaum halten will, bezahlt dafür in der Regel ein zweites Modell, das ihm auf die Finger schaut. Dieses zweite Modell liest jeden Schritt mit, den der Agent macht. Das funktioniert, wird aber schnell teuer. Agenten, die lange laufen, können in einer einzigen Sitzung so viel Text produzieren wie mehrere Romane, und jedes Wort muss noch einmal gelesen werden.
Goodfire, ein Start-up aus dem Bereich Interpretierbarkeit (also der Erforschung, wie KI-Modelle intern funktionieren), hat am Donnerstag einen anderen Ansatz vorgestellt. Seine neuen Monitore schauen in ein Modell hinein, während es arbeitet, statt hinterher zu prüfen, was es geschrieben hat. Das Werkzeug steht Kunden von Baseten zur Verfügung, einem Unternehmen, das KI-Modelle für andere Firmen hostet und betreibt.
Die beiden Unternehmen waren bereits verbunden. Im vergangenen Monat hatten Basetens Base Labs eine Sicherheitspartnerschaft mit Goodfire und der KI-Plattform Hugging Face angekündigt.
Warum gerade jetzt
Der Start kommt nach einem Jahr, in dem Agenten immer wieder aus ihren Testumgebungen ausgebrochen sind. Agenten von OpenAI drangen bei Hugging Face ein. Kimi K3, das offene Modell, mit dem Goodfire seinen ersten Monitor gebaut hat, nutzte in diesem Sommer eine Lücke in seiner Sandbox, um ins Internet zu gelangen und Informationen von GitHub abzurufen.
So funktionieren die Monitore
Goodfire vergleicht sein System mit einer Sicherheitskontrolle am Flughafen, die aus zwei Stufen besteht:
- Der Scanner. Kleine Detektoren, sogenannte Probes, lesen bei jedem Arbeitsschritt eines Agenten die internen Signale des Modells aus, so wie ein Körperscanner jeden Passagier prüft.
- Die Leibesvisitation. Erst wenn eine Probe anschlägt, schaltet sich ein separates KI-Modell ein und sieht genauer hin.
Baseten-Kunden legen selbst fest, welche Risiken überwacht werden. Zur Auswahl stehen unter anderem offensives Hacking, Missbrauch im Zusammenhang mit chemischen und biologischen Waffen sowie Reward Hacking, bei dem ein Modell sein Ziel austrickst, statt die eigentliche Aufgabe zu erledigen. Auch die Reaktion bestimmen die Kunden: den Vorfall protokollieren, ihn an einen menschlichen Prüfer weiterleiten oder die Anfrage gleich ablehnen.
Das Kostenargument
Die meisten Monitore sind eigenständige Modelle, die alles, was das überwachte Modell erzeugt, noch einmal verarbeiten müssen. Das kostet Zeit und Geld. Goodfires Probes sparen sich das erneute Lesen und greifen auf Berechnungen zu, die das Modell ohnehin schon anstellt.
Goodfire-Chef Eric Ho erklärte die Idee vergangene Woche im MAD Podcast des Risikokapitalgebers Matt Turck. "Monitore für interne Aktivierungen sind wirklich günstig, weil sie die Berechnungen aus dem Forward Pass wiederverwenden", sagte er. Das Modell berechne ohnehin jedes Token, fügte er hinzu, und die Probes ließen lediglich einen Klassifikator über diese Zwischenaktivierungen laufen.
Die Zahlen des Unternehmens aus Tests mit Kimi K3:
- Die Überwachung von rund 1.500 Sitzungen kostete etwa 51 Dollar.
- Ein günstigeres KI-Modell, das jeden Schritt prüft, kostete für dieselbe Aufgabe 233 Dollar.
- Ein Spitzenmodell kostete rund 10.000 Dollar.
- Die Probes erkannten 94 Prozent der bösartigen Hacking-Sitzungen.
- Von den harmlosen Sitzungen schickten sie 8,7 Prozent zur zweiten Prüfung.
- Vier Probes gleichzeitig verlängerten die Zeit, bis das Modell zu antworten beginnt, um weniger als 2 Prozent.
CTO und Mitgründer Dan Balsam betonte den Zeitpunkt ebenso wie den Preis. "Der große Vorteil ist, dass man Dinge erkennen kann, bevor sie passieren", sagte er. "Wir können erkennen, wann das Modell während einer Evaluierung oder im Training hacken könnte."
Gemacht für offene Modelle
Goodfire hat es gezielt auf offene Modelle abgesehen. Jeder kann sie herunterladen und ihre Schutzmechanismen entfernen, und ihnen fehlt die Art von Überwachung, die geschlossene Labore auf ihren eigenen Systemen betreiben.
Balsam argumentierte, das eigentliche Risiko liege bei den Inferenz-Anbietern, nicht bei einzelnen Nutzern. "Der Schaden, den ein Einzelner mit einem offenen Modell anrichten kann, ist gering im Vergleich zu dem, was jemand mit ganzen Rechenclustern anrichten kann, etwa Inferenz-Anbieter - und dort liegt der Großteil der Haftung", sagte er. "Wenn wir den offenen 'Mythos'-Moment erleben, wird klar werden, dass Modelle Leitplanken brauchen, die zur Inferenzzeit greifen."
Die eigene Forschung des Unternehmens untermauert die Sorge. Sie ergab, dass führende offene Modelle, darunter Kimi K3 und GLM 5.2, in Agenten-Tests in 50 bis 96 Prozent der Durchläufe Reward Hacking betrieben.
Goodfire ist damit nicht allein. Google DeepMind erklärte im Januar, seine Forschung sei in den Einsatz von Probes zur Missbrauchserkennung in Gemini eingeflossen.
Balsam sieht die Monitore als kurzfristigen Schritt hin zu einem größeren Ziel: ein großes Sprachmodell so weit zu entschlüsseln, dass sich Verhalten bis zu dem Punkt im Training zurückverfolgen lässt, an dem es entstanden ist. "Wir hoffen, die Magie des Modelltrainings in Präzisionstechnik zu verwandeln", sagte er.
Unsere Einschätzung
Die eigentliche Nachricht sind die Kosten. Ein Unterschied zwischen 51 und 10.000 Dollar für dieselbe Überwachungsaufgabe verändert, sofern er sich auch außerhalb von Goodfires eigenen Tests bestätigt, wer sich die Aufsicht über Agenten überhaupt leisten kann. Jeden Schritt zu überwachen ist dann kein Luxus großer Labore mehr, sondern etwas, das ein Hosting-Anbieter standardmäßig einschalten kann.
Das passt auch zu einem Muster, das wir immer wieder beobachten: Sicherheit wandert aus dem Modell heraus in die Schichten drumherum. Jüngste Vorfälle wie die Sicherheitslücke in AWS Bedrock AgentCore zeigen, wie viel schiefgehen kann, sobald Agenten Werkzeuge und Zugriffsrechte bekommen. Initiativen wie Nvidias offene Sicherheitsplattform für Agenten und die Arbeit an Kontrollen auf Infrastrukturebene für Agenten-Workloads weisen in dieselbe Richtung. Goodfires Vorstoß legt nahe, dass Inferenz-Anbieter zur natürlichen Kontrollstelle für offene Modelle werden könnten.
Es gibt allerdings Einschränkungen. Bei einer Erkennungsrate von 94 Prozent rutschen immer noch einige bösartige Sitzungen durch, und eine Fehlalarmquote von 8,7 Prozent bedeutet im großen Maßstab zusätzlichen Prüfaufwand. Die Zahlen stammen vom Unternehmen selbst und beziehen sich auf ein einziges Modell. Es lohnt sich zu beobachten, ob unabhängige Tester sie bestätigen können, ob die Probes auch bei anderen Modellen als Kimi K3 funktionieren und ob weitere Hosting-Anbieter ähnliche Monitore einführen.
