Los investigadores de Meta AI introdujeron Sweet-RL y CollaborativeAgentbench: un marco de aprendizaje de refuerzo gradual para capacitar a agentes del lenguaje múltiple para tareas realistas de colaboración de Human-AI.

Los modelos de lenguaje grande (LLM) se están transformando rápidamente en agentes autónomos capaces de realizar tareas complejas que requieren razonamiento, toma de decisiones y adaptabilidad. Estos agentes se implementan en navegación web, asistencia personal y desarrollo de software. Para actuar de manera efectiva en entornos del mundo real, estos agentes deben manejar interacciones múltiples que abarcan varios pasos o puntos de decisión. Esto introduce la necesidad de métodos de entrenamiento más allá de la simple generación de respuesta y, en cambio, se centra en optimizar toda la trayectoria de las interacciones. El aprendizaje de refuerzo (RL) ha surgido como un enfoque convincente para capacitar a dichos agentes refinando su toma de decisiones basadas en recompensas a largo plazo.

A pesar de su potencial, los agentes con sede en LLM luchan con la toma de decisiones de múltiples vueltas. Un desafío importante radica en asignar crédito adecuado a las acciones tomadas en etapas anteriores de interacción, que influyen en los resultados posteriores. Los métodos de capacitación tradicionales dependen de la predicción de la próxima token o imitan las acciones de alta probabilidad, que no tienen en cuenta las dependencias a largo plazo o los objetivos acumulativos. Como resultado, estos métodos no logran abordar la alta varianza y la ineficiencia de las tareas de Horizon Long, particularmente en escenarios de colaboración donde comprender la intención humana y el razonamiento en múltiples pasos es fundamental.

Se han adaptado varias técnicas de aprendizaje de refuerzo para ajustar los LLM, especialmente de los escenarios de retroalimentación humana de un solo cambio. Se han explorado herramientas como PPO, Raft y DPO, pero exhiben limitaciones significativas cuando se aplican a interacciones secuenciales. Estos métodos a menudo fallan en una asignación de crédito efectiva en turnos, lo que los hace menos efectivos para las tareas de toma de decisiones múltiples. Los puntos de referencia utilizados para evaluar tales herramientas carecen de la diversidad y la complejidad requeridas para evaluar el rendimiento en entornos colaborativos y del mundo real de manera robusta. Los enfoques de aprendizaje basados ​​en el valor son otra alternativa, pero su necesidad de cabezas personalizadas y grandes cantidades de datos de ajuste finos específicos de la tarea limitan sus capacidades de generalización.

Feria en los investigadores de Meta y UC Berkeley propusieron un nuevo método de aprendizaje de refuerzo llamado Sweet-RL (evaluación paso a paso de la información de tiempo de entrenamiento). También introdujeron un punto de referencia conocido como Colaborategentbench o colbench. Este punto de referencia es fundamental para el estudio, que proporciona más de 10,000 tareas de capacitación y más de 1,000 casos de prueba en dos dominios: programación de backend y diseño de frontend. Colbench simula una colaboración real entre un agente de IA y un socio humano, donde los agentes deben hacer preguntas, refinar su comprensión y proporcionar soluciones iterativas. Para la programación, los agentes deben escribir funciones en Python pidiendo aclaraciones para refinar las especificaciones faltantes. En las tareas delantera, los agentes deben generar código HTML que coincida con un objetivo visual a través de correcciones basadas en retroalimentación. Cada tarea está diseñada para estirar la capacidad de razonamiento del agente e imitar las limitaciones del mundo real, como interacciones limitadas, limitadas a 10 turnos por sesión.

Sweet-RL se construye alrededor de una estructura asimétrica del actor crítico. El crítico tiene acceso a información adicional durante la capacitación, como la solución correcta, que no es visible para el actor. Esta información permite al crítico evaluar cada decisión tomada por el agente con una resolución mucho más fina. En lugar de entrenar una función de valor que estima la recompensa general, Sweet-RL modela directamente una función de ventaja en cada turno, utilizando el objetivo de optimización de Bradley-Terry. La función de ventaja determina cuánto mejor o peor se compara una acción particular con las alternativas, ayudando al agente a aprender comportamientos precisos. Por ejemplo, si una acción se alinea mejor con las expectativas de la pareja humana, recibe una puntuación de mayor ventaja. Este método simplifica la asignación de crédito y se alinea mejor con la arquitectura previa al entrenamiento de LLMS, que depende de la predicción a nivel de token.

Sweet-RL logró una mejora absoluta del 6% sobre otros métodos de aprendizaje de refuerzo de múltiples vueltas en tareas de programación y diseño. En las tareas de programación de back-end, pasó el 48.0% de las pruebas y logró una tasa de éxito del 34.4%, en comparación con el 28.2% para DPO múltiple y 22.4% para el rendimiento de disparo cero. En las tareas de diseño frontend, alcanzó un puntaje de similitud de coseno de 76.9% y una tasa de ganancia de 40.4%, mejorando del 38.6% con DPO y 33.8% con ajuste fino. Incluso cuando se evaluó contra modelos principales como GPT-4O y O1-Mini, Sweet-RL cerró significativamente la brecha de rendimiento, lo que permite que el modelo LLAMA-3.1-8B de código abierto coincida o supere la tasa de victorias frontend de GPT-4O de 40.4%.

Esta investigación demuestra que la capacitación efectiva de los agentes interactivos depende de la retroalimentación precisa y giratoria en lugar de estimaciones de valor generalizadas o una amplia supervisión. Sweet-RL mejora significativamente la asignación de crédito al aprovechar la información del tiempo de entrenamiento y un enfoque de optimización alineado por la arquitectura. Mejora la generalización, reduce la varianza de entrenamiento y muestra una fuerte escalabilidad, logrando mejores resultados con un aumento de los datos. El algoritmo también sigue siendo efectivo cuando se aplica a conjuntos de datos fuera de política, lo que subraya su practicidad en escenarios del mundo real con datos imperfectos. El equipo de investigación creó un marco de evaluación significativo al introducir Colbench como un punto de referencia adaptado para tareas realistas de múltiples vueltas. Esta combinación con Sweet-RL proporciona una base sólida para los agentes en desarrollo que pueden razonar, adaptarse y colaborar de manera efectiva sobre interacciones extendidas.

Varias conclusiones clave de esta investigación incluyen:

  1. Sweet-RL mejoró las tasas de éxito de la programación de backend de 28.2% (DPO) a 34.4% y las tasas de ganancia de frontend de 38.6% a 40.4%.
  2. Permitió que LLAMA-3.1-8B coincida con el rendimiento de GPT-4O, reduciendo la dependencia de los modelos propietarios.
  3. El crítico utiliza información de tiempo de entrenamiento (por ejemplo, soluciones correctas) que es invisible para el actor, creando una configuración de entrenamiento asimétrico.
  4. Las tareas en Colbench están limitadas en 10 rondas por sesión e incluyen más de 10,000 ejemplos de capacitación generados en procedimiento.
  5. Colbench mide los resultados utilizando tasas de aprobación de prueba unitaria (para código) y similitud de coseno (para diseño web), proporcionando una evaluación confiable.
  6. Sweet-RL aprende directamente una función de ventaja de turno, mejorando la asignación de crédito sin necesidad de una función de valor intermedio.
  7. El modelo escala efectivamente con más datos y funciona bien incluso en conjuntos de datos fuera de política de modelos más débiles.
  8. En comparación con los métodos tradicionales de ajuste fino, Sweet-RL ofrece un rendimiento más alto con menos sobreajuste y mayor generalización.

Verificar el Papel, Página de Github y Conjunto de datos. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 85k+ ml de subreddit.


Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.