Google Cloud AI Research, con la UNC-Chapel Hill, Stanford y la Universidad de Washington en St. Louis, ha lanzado RRSI (Automejora recursiva regularizada). Permite que un agente de LLM reescriba su propio arnés: indicaciones, herramientas, memoria, flujo de control y subagentes. Los pesos de los modelos nunca cambian. RRSI limita el ciclo de mejora en sí, por lo que se afianza en los puntos de referencia con los que el agente nunca optimizó.
¿Implementable? Sí, como marco de investigación. El código es Apache 2.0, necesita Python 3.10+ y acepta cualquier cadena de modelo LiteLLM. Los valores predeterminados asumen Claude Opus 4.8 en Vertex AI.
Por qué los arneses de mejora personal se adaptan demasiado
Aprovecha los bucles de evolución que proponen ediciones, puntúalas en un conjunto de evolución fijo y mantén al ganador. Las mismas tareas se reutilizan en cada ronda, para que el bucle pueda memorizarlas. La investigación del RRSI nombra tres modos de falla: ajuste específico de referencia, persecución de ruido y acumulación de complejidad. Cada uno amplía la brecha entre las puntuaciones establecidas en la evolución y la transferencia real.
Cómo funciona RRSI
RRSI mantiene editables todos los componentes del arnés. En su lugar, regulariza cómo se mueve la búsqueda.
Lado de la propuesta
Presupuesto de edición recocido: un programa de coseno permite que las primeras rondas agrupen varias ediciones. Las últimas rondas permiten un único cambio atribuible. Crédito basado en evidencia: cada candidato se registra con su componente, hipótesis, diferencia, cambio de puntuación y cambio de costo. El proponente lee este libro de contabilidad, por lo que las ideas falsificadas no se vuelven a intentar. Exploración estructurada: cuando el progreso se estanca dentro de la banda de ruido, el presupuesto se desplaza a componentes que la ejecución nunca tocó.
Lado de selección
Crítico de fugas: rechaza nombres de tareas, entidades, respuestas o lógica específica de puntos de referencia antes de cualquier puntuación. Suelo con ajuste de ruido: las ganancias deben superar la variación medida en el arnés base sin cambios. Regla de costo: las fichas de inferencia adicionales deben pagarse mediante una ganancia medida. Poda: los componentes que dejan de producir ganancias se convierten en objetivos de eliminación.
El equipo de investigación los presenta como analogías con los regularizadores clásicos. El presupuesto de edición se asigna a L0, la poda a Lasso (L1) y la regla de costo a Ridge (L2).
Resultados en 8 puntos de referencia
Las 6 divisiones retenidas mejoraron. Con Gemini 3.5 Flash como política, Terminal-Bench 2.1 aumentó de 64,6 a 78,7. SWE-bench Verified subió de 76,8 a 79,0.
El arnés también es más ligero. En la instancia del espacio de trabajo agente, RRSI utiliza 2,42 millones de tokens de política por prueba. La evolución no regularizada utiliza 3,80M. El resumen informa que esto es un 30% menos; la página del proyecto dice 36%.
RRSI frente a competidores más cercanos
Las puntuaciones provienen de la Tabla 1 del artículo de investigación del RRSI. Todos los métodos comparten el mismo arnés inicial, política, división evolucionada y presupuesto candidato.
*Según el equipo de investigación de RRSI. El promedio de OOD es la media de JobBench, GDPval y APEX-Agents, calculado a partir de la Tabla 1.
Meta-Harness lidera la división de evolución de Harvey LAB. RRSI tiene la ganancia de evolución más pequeña pero el único OOD promedio más de 1 punto por encima de H0.
Explicador interactivo
Cómo RRSI regulariza la superación personal de los agentes
El modelo permanece congelado. El arnés (solicitudes, herramientas, memoria, flujo de control) evoluciona, pero cada edición debe pasar los regularizadores.
1. Realizar una ronda 2. Editar presupuesto 3. Puerta de aceptación 4. Resultados
Elija una edición candidata y luego presione Ejecutar. Observe dónde lo detiene RRSI.
Corrección de herramienta genérica Nombre de tarea codificado Ganancia de ruido interno Ganancia hambrienta de tokens Componente obsoleto ▶ Ejecutar
ProposerLee el libro de edición completo y reduce el presupuesto de edición
Crítico de fugasLas pantallas difieren antes de anotar
Evaluar Ejecutar en conjunto evolucionado
GateNoise suelo + regla de coste
Arnés Ht+1Aceptado, luego control de poda
Los candidatos son ilustrativos. Las reglas que cumplen son las descritas en el documento RRSI.
// editar libro mayor: componente | hipótesis | Δ puntuación | Δcosto | veredicto
Los 8 puntos de referencia versus métodos anteriores Costo del token
Empezando
Cada ronda selecciona a 2 candidatos en árboles de trabajo de git separados, los selecciona, evalúa a ambos y avanza rápidamente la rama hasta el ganador. La instancia de codificación también necesita Docker y Harbour. Los nuevos dominios se conectan a través de un único módulo adaptador.
Conclusiones clave
RRSI desarrolla indicaciones, herramientas, memoria y flujos de trabajo mientras los pesos de los modelos permanecen congelados. Un crítico de fugas, un piso de ruido, una regla de costos y una poda deciden qué ediciones se mantienen. Terminal-Bench 2.1 subió del 74,2% al 80,2% con Claude Opus 4.8. SWE-bench Verified, nunca utilizado para la selección, aumentó del 82,0% al 83,8%. Código Apache 2.0 en GitHub; Grado de investigación, no un producto oficial de Google.
Consulta el Documento, Códigos y Detalles técnicos. Todo el crédito es para el investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Asif Razzaq es el director ejecutivo de Marktechpost AI Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.