TL;DR: AgentFlow es un marco de agente entrenable con cuatro módulos (Planificador, Ejecutor, Verificador, Generador) coordinados por una memoria y un conjunto de herramientas explícitos. El planificador está optimizado en el bucle con un nuevo método basado en políticas, Flow-GRPO, que transmite una recompensa de resultado a nivel de trayectoria en cada turno y aplica actualizaciones estilo PPO a nivel de token con regularización de KL y ventajas normalizadas por grupo. En diez puntos de referencia, una red troncal 7B sintonizada con Flow-GRPO reporta +14,9% (búsqueda), +14,0% (agente), +14,5% (matemáticas) y +4,1% (ciencia) sobre líneas de base sólidas.
¿Qué es AgentFlow?
AgentFlow formaliza el razonamiento integrado en herramientas de múltiples turnos como un proceso de decisión de Markov (MDP). En cada turno, el Planificador propone un subobjetivo y selecciona una herramienta más un contexto; el Ejecutor llama a la herramienta; el Verificador indica si se debe continuar; el Generador emite la respuesta final al finalizar. Una memoria estructurada y en evolución registra estados, llamadas a herramientas y señales de verificación, lo que limita el crecimiento del contexto y hace que las trayectorias sean auditables. Sólo el planificador está capacitado; Otros módulos pueden ser motores fijos.
La implementación pública muestra un conjunto de herramientas modular (por ejemplo, base_generator, python_coder, google_search, wikipedia_search, web_search) y envía scripts de inicio rápido para inferencia, capacitación y evaluación comparativa. El repositorio tiene licencia del MIT.
Método de entrenamiento: Flow-GRPO
Flow-GRPO (Optimización de políticas refinadas de grupo basada en flujo) convierte la optimización a largo plazo y con escasas recompensas en actualizaciones manejables de un solo turno:
Transmisión de recompensa del resultado final: se asigna una señal única y verificable a nivel de trayectoria (corrección del LLM como juez) a cada giro, alineando los pasos de planificación local con el éxito global. Objetivo recortado a nivel de token: las proporciones ponderadas por importancia se calculan por token, con recorte al estilo PPO y una penalización de KL a una política de referencia para evitar la deriva. Ventajas normalizadas por grupo: la reducción de la variación entre grupos de implementaciones basadas en políticas estabiliza las actualizaciones.
Comprender los resultados y los puntos de referencia
Puntos de referencia. El equipo de investigación evalúa cuatro tipos de tareas: búsqueda intensiva en conocimiento (Bamboogle, 2Wiki, HotpotQA, Musique), razonamiento agente (división textual GAIA), matemáticas (AIME-24, AMC-23, Game of 24) y ciencias (GPQA, MedQA). GAIA es un referente orientado a herramientas para asistentes generales; la división textual excluye los requisitos multimodales.
Números principales (backbone 7B después de Flow-GRPO). Ganancias promedio sobre bases sólidas: +14,9% (búsqueda), +14,0% (agente), +14,5% (matemáticas), +4,1% (ciencia). El equipo de investigación afirma que su sistema 7B supera al GPT-4o en el conjunto informado. La página del proyecto también informa sobre los efectos de la capacitación, como una mejor calidad de la planificación, una reducción de los errores de llamada de herramientas (hasta un 28,4 % en GAIA) y tendencias positivas con mayores presupuestos de turnos y escala de modelo.
Ablaciones. Online Flow-GRPO mejora el rendimiento en un +17,2 % en comparación con una línea de base del planificador congelado, mientras que el ajuste fino supervisado fuera de línea del planificador degrada el rendimiento en un −19,0 % en su métrica compuesta.
Conclusiones clave
Agente modular, formación exclusiva para planificadores. AgentFlow estructura un agente en Planificador–Ejecutor–Verificador–Generador con una memoria explícita; sólo el Planificador está entrenado en bucle. Flow-GRPO convierte RL de largo horizonte en actualizaciones de un solo turno. Se transmite una recompensa de resultado a nivel de trayectoria en cada turno; las actualizaciones utilizan recorte de estilo PPO a nivel de token con regularización de KL y ventajas normalizadas por grupo. El equipo de investigación informó ganancias en 10 puntos de referencia. Con una red troncal de 7B, AgentFlow informa mejoras promedio de +14,9 % (búsqueda), +14,0 % (agentic/GAIA textual), +14,5 % (matemáticas), +4,1 % (ciencias) sobre líneas de base sólidas y estados que superan GPT-4o en la misma suite. Mejora la confiabilidad en el uso de herramientas. El equipo de investigación informó una reducción de los errores al llamar a las herramientas (por ejemplo, en GAIA) y una mejor calidad de la planificación con presupuestos de turno y escala de modelo más grandes.
AgentFlow formaliza a los agentes que utilizan herramientas en cuatro módulos (planificador, ejecutor, verificador, generador) y entrena solo al planificador en bucle a través de Flow-GRPO, que transmite una única recompensa a nivel de trayectoria en cada turno con actualizaciones estilo PPO a nivel de token y control KL. Los resultados informados en diez puntos de referencia muestran ganancias promedio de +14,9% (búsqueda), +14,0% (división textual agente/GAIA), +14,5% (matemáticas) y +4,1% (ciencia); El equipo de investigación también afirma que el sistema 7B supera al GPT-4o en este conjunto. La implementación, las herramientas y los scripts de inicio rápido tienen licencia MIT en el repositorio de GitHub.
Consulte el documento técnico, la página de GitHub y la página del proyecto. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.
🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.