RRSI de código abierto de Google Research: agentes de inteligencia artificial que mejoran su propio arnés sin sobreadaptarse

Google Cloud AI Research, con la UNC-Chapel Hill, Stanford y la Universidad de Washington en St. Louis, ha lanzado RRSI (Automejora recursiva regularizada). Permite que un agente de LLM reescriba su propio arnés: indicaciones, herramientas, memoria, flujo de control y subagentes. Los pesos de los modelos nunca cambian. RRSI limita el ciclo de mejora en sí, por lo que se afianza en los puntos de referencia con los que el agente nunca optimizó.

¿Implementable? Sí, como marco de investigación. El código es Apache 2.0, necesita Python 3.10+ y acepta cualquier cadena de modelo LiteLLM. Los valores predeterminados asumen Claude Opus 4.8 en Vertex AI.

Por qué los arneses de mejora personal se adaptan demasiado

Aprovecha los bucles de evolución que proponen ediciones, puntúalas en un conjunto de evolución fijo y mantén al ganador. Las mismas tareas se reutilizan en cada ronda, para que el bucle pueda memorizarlas. La investigación del RRSI nombra tres modos de falla: ajuste específico de referencia, persecución de ruido y acumulación de complejidad. Cada uno amplía la brecha entre las puntuaciones establecidas en la evolución y la transferencia real.

Cómo funciona RRSI

RRSI mantiene editables todos los componentes del arnés. En su lugar, regulariza cómo se mueve la búsqueda.

Lado de la propuesta

Presupuesto de edición recocido: un programa de coseno permite que las primeras rondas agrupen varias ediciones. Las últimas rondas permiten un único cambio atribuible. Crédito basado en evidencia: cada candidato se registra con su componente, hipótesis, diferencia, cambio de puntuación y cambio de costo. El proponente lee este libro de contabilidad, por lo que las ideas falsificadas no se vuelven a intentar. Exploración estructurada: cuando el progreso se estanca dentro de la banda de ruido, el presupuesto se desplaza a componentes que la ejecución nunca tocó.

Lado de selección

Crítico de fugas: rechaza nombres de tareas, entidades, respuestas o lógica específica de puntos de referencia antes de cualquier puntuación. Suelo con ajuste de ruido: las ganancias deben superar la variación medida en el arnés base sin cambios. Regla de costo: las fichas de inferencia adicionales deben pagarse mediante una ganancia medida. Poda: los componentes que dejan de producir ganancias se convierten en objetivos de eliminación.

El equipo de investigación los presenta como analogías con los regularizadores clásicos. El presupuesto de edición se asigna a L0, la poda a Lasso (L1) y la regla de costo a Ridge (L2).

Resultados en 8 puntos de referencia

Las 6 divisiones retenidas mejoraron. Con Gemini 3.5 Flash como política, Terminal-Bench 2.1 aumentó de 64,6 a 78,7. SWE-bench Verified subió de 76,8 a 79,0.

El arnés también es más ligero. En la instancia del espacio de trabajo agente, RRSI utiliza 2,42 millones de tokens de política por prueba. La evolución no regularizada utiliza 3,80M. El resumen informa que esto es un 30% menos; la página del proyecto dice 36%.

RRSI frente a competidores más cercanos

Las puntuaciones provienen de la Tabla 1 del artículo de investigación del RRSI. Todos los métodos comparten el mismo arnés inicial, política, división evolucionada y presupuesto candidato.

CaracterísticaRRSIMeta-HarnessAHETTHEHarnessXIdea principalPropuesta y selección regularizadasProponente agente sobre código, puntuaciones y rastros de todos los candidatos anterioresBucle impulsado por observabilidad; ediciones combinadas con predicciones verificadas Evoluciona el arnés durante el tiempo de prueba, sin etiquetas doradas Primitivas de tipo modular, adaptación basada en trazas Pesos de modelos Congelado Congelado Congelado Congelado Regla de costos y poda Sí No * No * No * No * Puntaje de evolución de Harvey LAB 90.593.090.791.191.8 Promedio OOD (H0 = 39.7)43.640.639.238.039.7

*Según el equipo de investigación de RRSI. El promedio de OOD es la media de JobBench, GDPval y APEX-Agents, calculado a partir de la Tabla 1.

Meta-Harness lidera la división de evolución de Harvey LAB. RRSI tiene la ganancia de evolución más pequeña pero el único OOD promedio más de 1 punto por encima de H0.

Explicador interactivo

Cómo RRSI regulariza la superación personal de los agentes

El modelo permanece congelado. El arnés (solicitudes, herramientas, memoria, flujo de control) evoluciona, pero cada edición debe pasar los regularizadores.

1. Realizar una ronda 2. Editar presupuesto 3. Puerta de aceptación 4. Resultados

Elija una edición candidata y luego presione Ejecutar. Observe dónde lo detiene RRSI.

Corrección de herramienta genérica Nombre de tarea codificado Ganancia de ruido interno Ganancia hambrienta de tokens Componente obsoleto ▶ Ejecutar

ProposerLee el libro de edición completo y reduce el presupuesto de edición

Crítico de fugasLas pantallas difieren antes de anotar

Evaluar Ejecutar en conjunto evolucionado

GateNoise suelo + regla de coste

Arnés Ht+1Aceptado, luego control de poda

Los candidatos son ilustrativos. Las reglas que cumplen son las descritas en el documento RRSI.

// editar libro mayor: componente | hipótesis | Δ puntuación | Δcosto | veredicto

Los 8 puntos de referencia versus métodos anteriores Costo del token

Empezando

git clone https://github.com/google-research/rrsi.git && cd rrsi pip install -e “.[dev]” python3 rrsi.py –línea base de codificación de dominio python3 rrsi.py –ejecución de codificación de dominio

Cada ronda selecciona a 2 candidatos en árboles de trabajo de git separados, los selecciona, evalúa a ambos y avanza rápidamente la rama hasta el ganador. La instancia de codificación también necesita Docker y Harbour. Los nuevos dominios se conectan a través de un único módulo adaptador.

Conclusiones clave

RRSI desarrolla indicaciones, herramientas, memoria y flujos de trabajo mientras los pesos de los modelos permanecen congelados. Un crítico de fugas, un piso de ruido, una regla de costos y una poda deciden qué ediciones se mantienen. Terminal-Bench 2.1 subió del 74,2% al 80,2% con Claude Opus 4.8. SWE-bench Verified, nunca utilizado para la selección, aumentó del 82,0% al 83,8%. Código Apache 2.0 en GitHub; Grado de investigación, no un producto oficial de Google.

Consulta el Documento, Códigos y Detalles técnicos. Todo el crédito es para el investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Asif Razzaq es el director ejecutivo de Marktechpost AI Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.