Inicialmente diseñada para tareas de control continuo, la optimización de políticas próximas (PPO) se ha utilizado ampliamente en aplicaciones de aprendizaje por refuerzo (RL), incluido el ajuste de modelos generativos. Sin embargo, la eficacia de PPO depende de múltiples heurísticas para una convergencia estable, como redes de valor y recorte, lo que hace que su implementación sea sensible y compleja. A pesar de esto, RL demuestra una versatilidad notable, pasando de tareas como el control continuo al ajuste de modelos generativos. Sin embargo, la adaptación de PPO, originalmente destinada a optimizar redes de dos capas, para ajustar los modelos generativos modernos con miles de millones de parámetros genera preocupación. Esto requiere almacenar múltiples modelos en la memoria simultáneamente y plantea dudas sobre la idoneidad de PPO para tales tareas. Además, el rendimiento de PPO varía ampliamente debido a detalles de implementación aparentemente triviales. Esto plantea la pregunta: ¿Existen algoritmos más simples que se adapten a las aplicaciones RL modernas?
Los métodos de gradiente de políticas (PG), reconocidos por su optimización directa de políticas basada en gradientes, son fundamentales en RL. Divididos en dos familias, los métodos de PG basados en REINFORCE a menudo incorporan técnicas de reducción de la varianza, mientras que las técnicas de PG adaptativas condicionan los gradientes de políticas para garantizar la estabilidad y una convergencia más rápida. Sin embargo, calcular e invertir la matriz de información de Fisher en métodos de PG adaptativos como TRPO plantea desafíos computacionales, lo que lleva a aproximaciones burdas como PPO.
Investigadores de Cornell, Princeton y la Universidad Carnegie Mellon presentan REBELDE: Regresión a la RL basada en recompensas relativas. Este algoritmo reduce el problema de la optimización de políticas al hacer una regresión de las recompensas relativas a través de la parametrización directa de políticas entre dos finalizaciones a un mensaje, lo que permite una implementación sorprendentemente liviana. El análisis teórico revela que REBEL es una base para algoritmos de RL como el gradiente de política natural, que coincide con las principales garantías teóricas de convergencia y eficiencia de la muestra. REBEL se adapta a datos fuera de línea y aborda preferencias intransitivas que son comunes en la práctica.
Los investigadores adoptan la formulación Contextual Bandit para RL, que es particularmente relevante para modelos como LLM y modelos de difusión debido a transiciones deterministas. Los pares de respuesta rápida se consideran con una función de recompensa para medir la calidad de la respuesta. El problema de RL restringido por KL está formulado para ajustar la política de acuerdo con las recompensas mientras se adhiere a una política de referencia. Una solución cerrada al problema de la entropía relativa se deriva de trabajos de investigación anteriores, lo que permite expresar la recompensa en función de la política. REBEL actualiza iterativamente la política basándose en un objetivo de pérdida cuadrada, utilizando muestras pareadas para aproximar la función de partición. Este objetivo central de REBEL tiene como objetivo ajustar las recompensas relativas entre pares de respuestas, buscando en última instancia resolver el problema de RL restringido por KL.
La comparación entre REBEL, SFT, PPO y DPO para modelos entrenados con LoRA revela el rendimiento superior de REBEL con respecto a la puntuación RM en todos los tamaños de modelos, aunque con una divergencia KL ligeramente mayor que PPO. En particular, REBEL logra la tasa de ganancia más alta en GPT4 cuando se compara con referencias humanas, lo que indica la ventaja de hacer una regresión de las recompensas relativas. La compensación entre la puntuación del modelo de recompensa y la divergencia KL, donde REBEL muestra una mayor divergencia pero logra puntuaciones RM más altas que PPO, especialmente hacia el final del entrenamiento.
En conclusión, esta investigación presenta REBEL, un algoritmo de RL simplificado que aborda el problema de RL resolviendo una serie de tareas de regresión de recompensa relativa en conjuntos de datos recopilados secuencialmente. A diferencia de los enfoques de gradiente de políticas, que a menudo se basan en redes y heurísticas adicionales como el recorte para la estabilidad de la optimización, REBEL se centra en reducir el error de entrenamiento en un problema de mínimos cuadrados, lo que lo hace notablemente sencillo de implementar y escalar. En teoría, REBEL se alinea con las garantías más sólidas disponibles para algoritmos RL en entornos agnósticos. En la práctica, REBEL demuestra un rendimiento competitivo o superior en comparación con métodos más complejos y que requieren muchos recursos en tareas de modelado de lenguaje y generación de imágenes guiadas.
Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo. Únete a nuestro Canal de telegramas, Canal de discordiay LinkedIn Grarriba.
Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..
No olvides unirte a nuestro SubReddit de más de 40.000 ml
Asjad es consultor interno en Marktechpost. Está cursando B.Tech en ingeniería mecánica en el Instituto Indio de Tecnología, Kharagpur. Asjad es un entusiasta del aprendizaje automático y el aprendizaje profundo que siempre está investigando las aplicaciones del aprendizaje automático en la atención médica.