Google RRSI evita que los agentes de IA se sobreajusten

Google RRSI evita que los agentes de IA se sobreajusten

Los agentes de IA que reescriben su propio andamiaje suelen volverse muy buenos en sus tareas de prueba y no mucho mejores en todo lo demás. Un nuevo artículo de Google Cloud AI Research y varias universidades describe un método que limita este efecto y, además, reduce los costes de computación.

El arnés hace buena parte del trabajo

Los agentes actuales suelen combinar un modelo de lenguaje fijo con un "arnés". Se trata de la capa de instrucciones, flujos de trabajo, herramientas, memoria y lógica de control que decide qué ve el modelo en cada paso. De ella depende que el agente abra el archivo correcto antes de editarlo, que se recupere tras un error y que devuelva resultados limpios.

El artículo sostiene que buena parte del progreso reciente de los agentes se debe a la mejora de los arneses, no a modelos nuevos. Proyectos como BootLoops demuestran hasta dónde puede llegar un modelo existente con un arnés bien construido.

Antes, el ajuste de los arneses era manual. Los ingenieros revisaban las ejecuciones fallidas y corregían la lógica a mano. Los enfoques más recientes automatizan este proceso. Un modelo de lenguaje reescribe el arnés una y otra vez a partir de los resultados de las tareas de prueba. Los investigadores lo describen como una forma práctica de automejora recursiva: el sistema genera información de retorno, la usa para modificar el arnés y el arnés, a su vez, determina cómo se comporta el sistema.

El problema de la memorización

El inconveniente es el sobreajuste. Cuando un agente se optimiza una y otra vez con el mismo conjunto reducido de tareas, empieza a memorizarlas. Las puntuaciones de entrenamiento suben. Las mejoras en tareas desconocidas se reducen o desaparecen.

El artículo señala tres formas en que ocurre esto:

  1. La búsqueda detecta patrones que solo funcionan en un banco de pruebas concreto.
  2. Favorece a los candidatos que han puntuado bien por casualidad.
  3. Añade complejidad que eleva la puntuación de la prueba sin hacer al agente más capaz.

Cómo funciona RRSI

El método se llama RRSI, siglas de Regularized Recursive Self-Improvement of Agent Harnesses. El arnés sigue siendo totalmente editable. RRSI añade controles en dos puntos del ciclo.

Al proponer cambios. Un presupuesto limita cuántas modificaciones independientes puede agrupar un candidato. Ese presupuesto se reduce con el tiempo. Las primeras rondas permiten reescrituras más amplias. Las últimas solo admiten pequeños cambios cuyo efecto pueda rastrearse con claridad. El sistema también recuerda los intentos anteriores para no repetir ideas fallidas. Si el progreso se estanca, prueba deliberadamente cambios en partes del arnés que aún no ha tocado.

Al aceptar cambios. Un crítico revisa cada propuesta y rechaza las que fijan en el código nombres de tareas, soluciones u otros atajos específicos de un banco de pruebas. Solo se aceptan mayores costes de computación si van acompañados de una mejora de rendimiento medible. Los componentes que dejan de aportar se eliminan.

Los resultados

El equipo probó RRSI en ocho bancos de pruebas que abarcan programación, trabajo de oficina con agentes y diseño de ingeniería. El modelo subyacente, Claude Opus 4.8, permaneció congelado en todo momento. RRSI se comparó con el arnés de referencia sin modificar y con cuatro métodos de optimización recientes.

Según el artículo, RRSI ganó hasta 14,1 puntos en sus tareas de entrenamiento y hasta 4,7 puntos en cinco bancos de pruebas que nunca había visto. La mayor mejora en tareas desconocidas se dio en JobBench. Usó alrededor de un 30 por ciento menos de tokens en ejecución que la versión sin regularizar. En ninguno de los bancos de pruebas desconocidos quedó por debajo de la referencia.

Lo interesante es la comparación. Todos los métodos mejoraron en las tareas de entrenamiento. En tareas nuevas, el panorama se invirtió. Dos métodos acabaron por debajo del arnés de referencia. RRSI obtuvo la menor mejora en entrenamiento de todas las variantes, pero fue la única claramente por encima de la referencia en tareas desconocidas. Ese equilibrio es justo lo que buscan las salvaguardas. Entre los arneses optimizados, RRSI fue el que menos tokens y pasos utilizó, aunque la referencia sin tocar era aún más austera.

Los arneses también se podían trasladar de un modelo a otro. Un arnés de programación optimizado con Gemini 3.5 Flash elevó al mucho más débil Gemini 3.1 Flash Lite de 11,2 a 14,6 puntos sin ningún cambio. Los autores afirman que los mecanismos encontrados no dependen de la potencia del modelo utilizado para descubrirlos.

El estudio solo abarca arneses en torno a modelos congelados. No aborda los casos en que cambian los pesos del modelo. El código está en GitHub.

Por qué importa

Para los equipos que desarrollan agentes, esto indica que el arnés merece el mismo escrutinio que el modelo, incluido el riesgo de ajustarlo hasta convertirlo en un especialista en bancos de pruebas. El artículo recuerda una advertencia conocida: en ARC-AGI-3, Opus 4.6 con un arnés hecho a medida obtuvo un 97,1 por ciento en un entorno conocido y un 0 por ciento en uno desconocido.

RRSI encaja además en una tendencia más amplia: mejorar los agentes sin reentrenar los modelos. SoL-Pi, de Nvidia, pone a un agente de investigación a reconstruir arneses de agentes de programación y reduce el uso de tokens hasta en un 49 por ciento. Google ya había hecho que sus agentes "soñaran" con búsquedas anteriores. Los desarrolladores ya personalizan el comportamiento de los agentes a mano. Automatizarlo de forma segura es el siguiente paso.

El crítico es la pieza que hay que vigilar. Los agentes no siempre saben juzgar su propio trabajo. Habrá que ver si grupos independientes reproducen estas mejoras en tareas desconocidas y si el enfoque se sostiene cuando también cambian los pesos del modelo.