Google RRSI: Selbstoptimierende KI-Agenten ohne Overfitting
KI-Agenten, die ihr eigenes Gerüst umschreiben, werden bei ihren Testaufgaben oft sehr gut und bei allem anderen kaum besser. Ein neues Paper von Google Cloud AI Research und mehreren Universitäten beschreibt eine Methode, die diesen Effekt begrenzt und zugleich Rechenkosten spart.
Das Harness leistet einen Großteil der Arbeit
Heutige Agenten kombinieren meist ein festes Sprachmodell mit einem "Harness". Das ist die Schicht aus Prompts, Abläufen, Werkzeugen, Gedächtnis und Steuerlogik, die festlegt, was das Modell bei jedem Schritt zu sehen bekommt. Sie entscheidet, ob der Agent die richtige Datei öffnet, bevor er sie bearbeitet, ob er sich nach einem Fehler wieder fängt und ob er saubere Ergebnisse zurückgibt.
Das Paper argumentiert, dass ein Großteil der jüngsten Fortschritte bei Agenten auf bessere Harnesses zurückgeht und nicht auf neue Modelle. Projekte wie BootLoops zeigen, wie weit ein gut gebautes Harness ein bestehendes Modell bringen kann.
Früher wurden Harnesses von Hand abgestimmt. Entwickler gingen fehlgeschlagene Durchläufe durch und besserten die Logik manuell nach. Neuere Ansätze automatisieren das. Ein Sprachmodell schreibt das Harness immer wieder um, gestützt auf Rückmeldungen aus Testaufgaben. Die Forscher beschreiben das als praktische Form rekursiver Selbstverbesserung: Das System erzeugt Feedback, ändert damit das Harness, und das Harness prägt dann wiederum, wie sich das System verhält.
Das Problem mit dem Auswendiglernen
Der Haken heißt Overfitting. Wenn ein Agent immer wieder auf dieselbe kleine Aufgabenmenge hin optimiert, fängt er an, sie auswendig zu lernen. Die Trainingswerte steigen. Die Zugewinne bei unbekannten Aufgaben schrumpfen oder verschwinden ganz.
Das Paper nennt drei Wege, wie das passiert:
- Die Suche greift Muster auf, die nur bei einem bestimmten Benchmark funktionieren.
- Sie bevorzugt Kandidaten, die zufällig gut abgeschnitten haben.
- Sie fügt Komplexität hinzu, die den Testwert hebt, ohne den Agenten tatsächlich fähiger zu machen.
So funktioniert RRSI
Die Methode heißt RRSI, kurz für Regularized Recursive Self-Improvement of Agent Harnesses. Das Harness bleibt vollständig veränderbar. RRSI setzt an zwei Stellen der Schleife Kontrollen.
Änderungen vorschlagen. Ein Budget begrenzt, wie viele unabhängige Änderungen ein Kandidat bündeln darf. Das Budget schrumpft mit der Zeit. Frühe Runden erlauben größere Umbauten. Spätere Runden lassen nur kleine Änderungen zu, deren Wirkung sich klar nachvollziehen lässt. Außerdem merkt sich das System frühere Versuche, damit es gescheiterte Ideen nicht immer wieder ausprobiert. Stockt der Fortschritt, probiert es gezielt Änderungen an Teilen des Harness aus, die es bisher nicht angefasst hat.
Änderungen annehmen. Ein Kritiker prüft jeden Vorschlag und lehnt alle ab, die Aufgabennamen, Lösungen oder andere benchmarkspezifische Abkürzungen fest einprogrammieren. Höhere Rechenkosten werden nur akzeptiert, wenn sie mit einem messbaren Leistungsgewinn einhergehen. Komponenten, die nichts mehr bringen, fliegen raus.
Die Ergebnisse
Das Team testete RRSI auf acht Benchmarks aus den Bereichen Programmierung, agentische Büroarbeit und technisches Design. Das zugrunde liegende Modell, Claude Opus 4.8, blieb dabei durchgehend eingefroren. RRSI wurde mit dem unveränderten Ausgangs-Harness und vier aktuellen Optimierungsmethoden verglichen.
Laut Paper legte RRSI bei seinen Trainingsaufgaben um bis zu 14,1 Punkte zu und auf fünf Benchmarks, die es nie gesehen hatte, um bis zu 4,7 Punkte. Der größte Zugewinn bei unbekannten Aufgaben gelang auf JobBench. Zur Laufzeit verbrauchte RRSI etwa 30 Prozent weniger Tokens als die Version ohne Regularisierung. Auf keinem der unbekannten Benchmarks fiel es unter den Ausgangswert.
Spannend wird es beim Vergleich. Jede Methode verbesserte sich bei den Trainingsaufgaben. Bei neuen Aufgaben kehrte sich das Bild um. Zwei Methoden landeten unter dem Ausgangs-Harness. RRSI hatte von allen Varianten den kleinsten Trainingsgewinn, lag aber als einzige bei unbekannten Aufgaben klar über dem Ausgangswert. Genau diesen Kompromiss sollen die Leitplanken herbeiführen. Unter den optimierten Harnesses brauchte RRSI die wenigsten Tokens und Schritte, auch wenn das unangetastete Ausgangs-Harness noch sparsamer war.
Die Harnesses ließen sich auch auf andere Modelle übertragen. Ein mit Gemini 3.5 Flash optimiertes Coding-Harness hob das deutlich schwächere Gemini 3.1 Flash Lite ohne jede Änderung von 11,2 auf 14,6 Punkte. Die Autoren sagen, die gefundenen Mechanismen hingen nicht davon ab, wie stark das Modell ist, mit dem sie entdeckt wurden.
Die Studie behandelt nur Harnesses rund um eingefrorene Modelle. Fälle, in denen sich die Modellgewichte ändern, bleiben außen vor. Der Code liegt auf GitHub.
Warum das wichtig ist
Für Teams, die Agenten bauen, heißt das: Das Harness verdient dieselbe genaue Prüfung wie das Modell, einschließlich des Risikos, es zu einem Benchmark-Spezialisten zu trimmen. Das Paper verweist auf ein bekanntes Warnsignal: Auf ARC-AGI-3 erreichte Opus 4.6 mit einem eigens gebauten Harness in einer vertrauten Umgebung 97,1 Prozent und in einer unbekannten 0 Prozent.
RRSI passt auch zu einem breiteren Trend, Agenten zu verbessern, ohne Modelle neu zu trainieren. Bei Nvidias SoL-Pi baut ein Forschungsagent die Harnesses von Coding-Agenten neu und senkt den Tokenverbrauch um bis zu 49 Prozent. Google ließ schon früher Agenten von vergangenen Suchläufen "träumen". Entwickler passen das Verhalten von Agenten bereits von Hand an. Das sicher zu automatisieren, ist der nächste Schritt.
Der Kritiker ist das Element, auf das man achten sollte. Agenten können ihre eigenen Ergebnisse nicht immer gut beurteilen. Es lohnt sich zu beobachten, ob unabhängige Gruppen die Zugewinne bei unbekannten Aufgaben reproduzieren können und ob der Ansatz auch dann trägt, wenn sich zusätzlich die Modellgewichte ändern.
