Google RRSI remt overfitting van zelfverbeterende agents

Google RRSI remt overfitting van zelfverbeterende agents

AI-agents die hun eigen scaffolding herschrijven, worden vaak heel goed in hun testtaken en nauwelijks beter in al het andere. Een nieuw paper van Google Cloud AI Research en een aantal universiteiten beschrijft een methode die dat effect beperkt en bovendien rekenkosten bespaart.

Het harnas doet veel van het werk

De agents van nu combineren meestal een vast taalmodel met een "harnas". Dat is de laag van prompts, workflows, tools, geheugen en besturingslogica die bepaalt wat het model bij elke stap te zien krijgt. Die laag bepaalt of de agent het juiste bestand opent voordat hij het bewerkt, of hij herstelt na een fout en of hij nette resultaten oplevert.

Volgens het paper komt een groot deel van de recente vooruitgang bij agents voort uit betere harnassen, niet uit nieuwe modellen. Projecten als BootLoops laten zien hoe ver een goed gebouwd harnas een bestaand model kan brengen.

Vroeger was het afstellen van een harnas handwerk. Engineers spitten mislukte runs door en pasten de logica met de hand aan. Nieuwere methoden automatiseren dat. Een taalmodel herschrijft het harnas steeds opnieuw, op basis van feedback uit testtaken. De onderzoekers zien dat als een praktische vorm van recursieve zelfverbetering: het systeem genereert feedback, gebruikt die om het harnas aan te passen, en het harnas bepaalt vervolgens hoe het systeem zich gedraagt.

Het probleem van uit het hoofd leren

Het addertje onder het gras is overfitting. Als een agent blijft optimaliseren op dezelfde kleine set taken, gaat hij die uit het hoofd leren. De trainingsscores stijgen. De winst op onbekende taken krimpt of verdwijnt.

Het paper noemt drie manieren waarop dat gebeurt:

  1. De zoektocht pikt patronen op die alleen werken op één specifieke benchmark.
  2. Hij geeft de voorkeur aan kandidaten die toevallig goed scoorden.
  3. Hij voegt complexiteit toe die de testscore opkrikt zonder dat de agent er echt beter van wordt.

Zo werkt RRSI

De methode heet RRSI, kort voor Regularized Recursive Self-Improvement of Agent Harnesses. Het harnas blijft volledig aanpasbaar. RRSI voegt op twee punten in de lus controles toe.

Wijzigingen voorstellen. Een budget beperkt hoeveel onafhankelijke aanpassingen een kandidaat mag bundelen. Dat budget wordt in de loop van de tijd kleiner. In de eerste rondes zijn grotere herschrijvingen toegestaan. In latere rondes mogen alleen nog kleine wijzigingen waarvan het effect duidelijk te herleiden is. Het systeem onthoudt ook eerdere pogingen, zodat het mislukte ideeën niet steeds opnieuw probeert. Loopt de vooruitgang vast, dan probeert het bewust wijzigingen in delen van het harnas die het nog niet heeft aangeraakt.

Wijzigingen accepteren. Een criticus controleert elk voorstel en wijst alles af wat taaknamen, oplossingen of andere benchmarkspecifieke binnenweggetjes hardcodeert. Hogere rekenkosten worden alleen geaccepteerd als ze gepaard gaan met een meetbare prestatiewinst. Onderdelen die niet meer helpen, worden verwijderd.

De resultaten

Het team testte RRSI op acht benchmarks op het gebied van programmeren, agentisch kantoorwerk en technisch ontwerp. Het onderliggende model, Claude Opus 4.8, bleef de hele tijd bevroren. RRSI werd vergeleken met het ongewijzigde basisharnas en vier recente optimalisatiemethoden.

Volgens het paper won RRSI tot 14,1 punten op zijn trainingstaken en tot 4,7 punten op vijf benchmarks die het nooit had gezien. De grootste winst op onbekend terrein was er op JobBench. Tijdens het draaien gebruikte het zo'n 30 procent minder tokens dan de niet-geregulariseerde versie. Op geen enkele onbekende benchmark zakte het onder de baseline.

De vergelijking is het interessante deel. Elke methode ging vooruit op de trainingstaken. Op nieuwe taken draaide het beeld om. Twee methoden eindigden onder het basisharnas. RRSI boekte van alle varianten de kleinste trainingswinst, maar was de enige die op onbekende taken duidelijk boven de baseline uitkwam. Precies die afweging is waar de vangrails voor bedoeld zijn. Van de geoptimaliseerde harnassen gebruikte RRSI de minste tokens en stappen, al was het onaangeroerde basisharnas nog zuiniger.

Harnassen bleken ook over te zetten naar andere modellen. Een programmeerharnas dat met Gemini 3.5 Flash was geoptimaliseerd, tilde het veel zwakkere Gemini 3.1 Flash Lite zonder aanpassingen van 11,2 naar 14,6 punten. Volgens de auteurs hangen de gevonden mechanismen niet af van de kracht van het model waarmee ze zijn ontdekt.

Het onderzoek gaat alleen over harnassen rond bevroren modellen. Situaties waarin de modelgewichten veranderen, komen niet aan bod. De code staat op GitHub.

Waarom het ertoe doet

Voor teams die agents bouwen, betekent dit dat het harnas net zo kritisch bekeken moet worden als het model, inclusief het risico dat je het afstelt tot een benchmarkspecialist. Het paper wijst op een bekende waarschuwing: op ARC-AGI-3 scoorde Opus 4.6 met een speciaal gebouwd harnas 97,1 procent in een vertrouwde omgeving en 0 procent in een onbekende.

RRSI past ook in een bredere trend om agents te verbeteren zonder modellen opnieuw te trainen. Bij Nvidia's SoL-Pi bouwt een onderzoeksagent harnassen voor programmeeragents opnieuw op, wat het tokengebruik met tot 49 procent verlaagt. Google liet agents eerder "dromen" over eerdere zoekruns. Ontwikkelaars passen het gedrag van agents nu al met de hand aan. Dat veilig automatiseren is de volgende stap.

De criticus is het onderdeel om in de gaten te houden. Agents zijn niet altijd goed in het beoordelen van hun eigen werk. Het is de moeite waard om te volgen of onafhankelijke groepen deze winst op onbekende taken kunnen reproduceren, en of de aanpak overeind blijft zodra ook de modelgewichten veranderen.