Google AI propone razonamiento Bank: un marco de memoria de agente de nivel I de estrategia que hace que los agentes de LLM sean autovolucionados en el tiempo de prueba

¿Cómo se hace que un agente de LLM realmente aprenda de sus propias carreras (éxito y fallas, sin recarerme? Google Research propone razonamiento Bank, un marco de memoria de agente de IA que convierte las trazas de interacción de un agente, tanto éxitos como fallas, en estrategias de razonamiento reutilizables de alto nivel. Estas estrategias se recuperan para guiar las decisiones futuras, y el bucle se repite para que el agente se auto evolucione. Junto con la escala de tiempo de prueba consciente de la memoria (MATTS), el enfoque ofrece hasta +34.2% de ganancias de efectividad relativa y –16% menos pasos de interacción en los puntos de referencia web y de ingeniería de software en comparación con los diseños de memoria anteriores que almacenan trayectorias sin procesar o flujos de trabajo de solo éxito.

https://arxiv.org/pdf/2509.25140

Entonces, ¿cuál es el problema?

Los agentes de LLM se enfrentan a tareas de varios pasos (navegación web, uso de la computadora, corrección de errores a nivel de repose) pero generalmente no pueden acumular y reutilizar la experiencia. La “memoria” convencional tiende a acumular registros sin procesar o flujos de trabajo rígidos. Esos son frágiles en los entornos y a menudo ignoran las señales útiles de los fracasos, donde viven muchos conocimientos procesables. El banco de razonamiento replantea la memoria como elementos de estrategia compactos y legibles por humanos que son más fáciles de transferir entre tareas y dominios.

Entonces, ¿cómo se enfrenta?

Cada experiencia se destila en un elemento de memoria con un título, una descripción de una línea y contenido que contiene principios procesables (heurística, cheques, restricciones). La recuperación está basada en la incrustación: para una nueva tarea, los elementos relevantes de Top-K se inyectan como guía del sistema; Después de la ejecución, se extraen y consolidan nuevos elementos. El bucle es intencionalmente simple: reconstruir → inyección → jueces → destilado → apéndice), por lo que las mejoras pueden atribuirse a la abstracción de estrategias, no la gestión de la memoria pesada.

🚨 [Recommended Read] VIPE (Video Pose Engine): una herramienta de anotación de video 3D potente y versátil para AI espacial

Por qué transfiere: los elementos codifican patrones de razonamiento (“Prefiere páginas de cuenta para datos específicos del usuario; verificar el modo de paginación; evite las trampas de desplazamiento infinito; el estado de verificación cruzada con las especificaciones de la tarea”), no los pasos DOM específicos del sitio web. Las fallas se convierten en restricciones negativas (“No confíe en la búsqueda cuando el sitio deshabilite la indexación; confirme el estado de guardado antes de la navegación”), lo que evita los errores repetidos.

https://arxiv.org/pdf/2509.25140

¡También se propuso la escalado de tiempo de prueba de memoria (MATTS)!

La escala de tiempo de prueba (ejecutar más despliegue o refinamientos por tarea) es efectivo solo si el sistema puede aprender de las trayectorias adicionales. El equipo de investigación también propuso escala de tiempo de prueba consciente de la memoria (MATTS) que integra la escala con el banco de razones:

Matts paralelos: generar (k) despliegue en paralelo, luego autocrastrarlos para refinar la memoria de la estrategia. Matts secuenciales: se autorrefina iterativamente una trayectoria única, minería de notas intermedias como señales de memoria.

La sinergia es bidireccional: la exploración más rica produce una mejor memoria; Una mejor memoria de la exploración de la exploración hacia ramas prometedoras. Empíricamente, Matts produce ganancias más fuertes y monotónicas que la de vainilla Best of-N sin memoria.

Entonces, ¿qué tan buenos son estos marcos de investigación propuestos?

Efectividad: el razonamiento Bank + Matts mejora el éxito de la tarea hasta el 34.2% (relativo) sobre la no memoria y supera los diseños de memoria anteriores que reutilizan trazas sin procesar o rutinas solo con éxito. Eficiencia: los pasos de interacción disminuyen en un 16% en general; Un análisis posterior muestra las mayores reducciones en ensayos exitosos, lo que indica menos acciones redundantes en lugar de abortos prematuros.

https://arxiv.org/pdf/2509.25140

¿Dónde encaja esto en la pila de agentes?

RazoningBank es una capa de memoria enchufable para agentes interactivos que ya usan bucles de decisión de estilo React o la mejor escala de tiempo de prueba de N. No reemplaza los verificadores/planificadores; Los amplifica inyectando lecciones destiladas a nivel de inmediato/sistema. En las tareas web, complementa BrowsergyM/Webarena/Mind2Web; En las tareas de software, las capas de TI sobre las configuraciones verificadas de SWE-Bench.

Mira el papel aquí. No dude en consultar nuestra página de GitHub para obtener tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro subreddit de 100k+ ml y suscribirse a nuestro boletín. ¡Esperar! ¿Estás en Telegram? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.

🔥[Recommended Read] NVIDIA AI Open-Sources Vipe (motor de pose de video): una herramienta de anotación de video 3D potente y versátil para AI espacial