RRSI : Google limite le surapprentissage des agents IA
Les agents IA qui réécrivent leur propre échafaudage ont tendance à devenir très bons sur leurs tâches de test, mais pas beaucoup meilleurs sur le reste. Un nouvel article de Google Cloud AI Research et de plusieurs universités décrit une méthode qui limite cet effet tout en réduisant les coûts de calcul.
Le harnais fait une bonne partie du travail
Les agents actuels associent généralement un modèle de langage figé à un "harnais". Il s'agit de la couche de prompts, de flux de travail, d'outils, de mémoire et de logique de contrôle qui décide de ce que le modèle voit à chaque étape. C'est elle qui détermine si l'agent ouvre le bon fichier avant de le modifier, s'il se rattrape après une erreur et s'il rend des résultats propres.
Selon l'article, une grande partie des progrès récents des agents vient de l'amélioration des harnais, et non de nouveaux modèles. Des projets comme BootLoops montrent jusqu'où un harnais bien conçu peut mener un modèle existant.
Le réglage des harnais se faisait autrefois à la main. Les ingénieurs épluchaient les exécutions ratées et corrigeaient la logique manuellement. Des approches plus récentes automatisent ce travail. Un modèle de langage réécrit le harnais à répétition, en s'appuyant sur les retours des tâches de test. Les chercheurs y voient une forme pratique d'auto-amélioration récursive : le système génère des retours, s'en sert pour modifier le harnais, et le harnais façonne ensuite le comportement du système.
Le problème de la mémorisation
Le hic, c'est le surapprentissage. Quand un agent s'optimise sans cesse sur le même petit ensemble de tâches, il finit par les mémoriser. Les scores d'entraînement grimpent. Les gains sur des tâches inédites s'amenuisent ou disparaissent.
L'article identifie trois façons dont cela se produit :
- La recherche capte des schémas qui ne fonctionnent que sur un benchmark précis.
- Elle privilégie des candidats qui ont obtenu de bons scores par hasard.
- Elle ajoute de la complexité qui fait monter le score de test sans rendre l'agent plus compétent.
Comment fonctionne RRSI
La méthode s'appelle RRSI, pour Regularized Recursive Self-Improvement of Agent Harnesses. Le harnais reste entièrement modifiable. RRSI ajoute des garde-fous à deux endroits de la boucle.
Proposer des modifications. Un budget limite le nombre de modifications indépendantes qu'un candidat peut regrouper. Ce budget diminue au fil du temps. Les premiers cycles autorisent des réécritures plus larges. Les cycles suivants n'admettent que de petits changements dont l'effet peut être clairement retracé. Le système garde aussi en mémoire les tentatives passées pour ne pas réessayer sans cesse des idées qui ont échoué. Si les progrès stagnent, il tente délibérément des modifications dans des parties du harnais qu'il n'a pas encore touchées.
Accepter des modifications. Un critique examine chaque proposition et rejette celles qui codent en dur des noms de tâches, des solutions ou d'autres raccourcis propres au benchmark. Un coût de calcul plus élevé n'est accepté que s'il s'accompagne d'un gain de performance mesurable. Les composants qui n'apportent plus rien sont supprimés.
Les résultats
L'équipe a testé RRSI sur huit benchmarks couvrant la programmation, le travail de bureau agentique et la conception technique. Le modèle sous-jacent, Claude Opus 4.8, est resté figé tout du long. RRSI a été comparé au harnais de référence non modifié et à quatre méthodes d'optimisation récentes.
D'après l'article, RRSI a gagné jusqu'à 14,1 points sur ses tâches d'entraînement et jusqu'à 4,7 points sur cinq benchmarks qu'il n'avait jamais vus. Le gain le plus important sur un benchmark inédit a été obtenu sur JobBench. Il a consommé environ 30 % de tokens en moins à l'exécution que la version non régularisée. Sur aucun des benchmarks inédits il n'est passé sous la référence.
C'est la comparaison qui est intéressante. Toutes les méthodes ont progressé sur les tâches d'entraînement. Sur de nouvelles tâches, la tendance s'est inversée. Deux méthodes ont fini sous le harnais de référence. RRSI affichait le plus faible gain d'entraînement de toutes les variantes, mais c'était la seule nettement au-dessus de la référence sur les tâches inédites. C'est précisément le compromis que les garde-fous sont censés produire. Parmi les harnais optimisés, RRSI est celui qui a utilisé le moins de tokens et d'étapes, même si le harnais de référence intact restait encore plus sobre.
Les harnais se sont aussi transférés d'un modèle à l'autre. Un harnais de programmation optimisé avec Gemini 3.5 Flash a fait passer le bien plus faible Gemini 3.1 Flash Lite de 11,2 à 14,6 points, sans aucune modification. Selon les auteurs, les mécanismes découverts ne dépendent pas de la puissance du modèle qui a servi à les trouver.
L'étude ne porte que sur des harnais entourant des modèles figés. Les cas où les poids du modèle changent ne sont pas abordés. Le code est disponible sur GitHub.
Pourquoi c'est important
Pour les équipes qui conçoivent des agents, cela suggère que le harnais mérite la même attention que le modèle, y compris face au risque d'en faire, à force de réglages, un spécialiste du benchmark. L'article rappelle un avertissement bien connu : sur ARC-AGI-3, Opus 4.6 doté d'un harnais conçu sur mesure a obtenu 97,1 % dans un environnement familier et 0 % dans un environnement inconnu.
RRSI s'inscrit aussi dans une tendance plus large : améliorer les agents sans réentraîner les modèles. Avec SoL-Pi de Nvidia, un agent de recherche reconstruit les harnais d'agents de programmation, ce qui réduit la consommation de tokens jusqu'à 49 %. Google avait déjà fait "rêver" des agents à partir de leurs anciennes recherches. Les développeurs personnalisent déjà le comportement des agents à la main. Automatiser cela en toute sécurité, c'est l'étape suivante.
Le critique est l'élément à surveiller. Les agents ne sont pas toujours doués pour juger leur propre production. Reste à voir si des équipes indépendantes reproduisent ces gains sur des tâches inédites, et si l'approche tient la route quand les poids du modèle changent eux aussi.
