Google AI Research presenta el marco de optimización de preferencias por listas (LiPO): un nuevo enfoque de inteligencia artificial para alinear modelos de lenguaje con comentarios humanos

Alinear los modelos lingüísticos con las preferencias humanas es la piedra angular para su aplicación eficaz en muchos escenarios del mundo real. Con los avances en el aprendizaje automático, la búsqueda de perfeccionar estos modelos para lograr una mejor alineación ha llevado a los investigadores a explorar más allá de los métodos tradicionales y sumergirse en la optimización de preferencias. Este campo promete aprovechar la retroalimentación humana de manera más intuitiva y efectiva.

Los desarrollos recientes han pasado del aprendizaje por refuerzo convencional a partir de la retroalimentación humana (RLHF) hacia enfoques innovadores como la optimización directa de políticas (DPO) y SLiC. Estos métodos optimizan los modelos de lenguaje basados ​​en datos de preferencias humanas por pares, una técnica que, si bien es efectiva, solo roza la superficie de posibles estrategias de optimización. Un estudio innovador realizado por investigadores de Google Research y Google Deepmind presenta el marco Listwise Preference Optimization (LiPO), que reformula la alineación de LM como un desafío de clasificación por listas, en paralelo al dominio establecido Learning-to-Rank (LTR). Este enfoque innovador se alinea con la rica tradición de LTR. Amplía significativamente el alcance de la optimización de preferencias al aprovechar los datos por listas, donde las respuestas se clasifican en listas para economizar los esfuerzos de evaluación necesarios.

En el corazón de LiPO se encuentra el reconocimiento del potencial sin explotar de los datos de preferencias por listas. Tradicionalmente, los datos de preferencias humanas se procesan por pares, un método que, aunque funcional, no explota plenamente la riqueza informativa de las listas clasificadas. LiPO trasciende esta limitación al proponer un marco que puede aprender de manera más efectiva de las preferencias por listas. A través de una exploración en profundidad de varios objetivos de clasificación dentro de este marco, el estudio destaca LiPO-λ, que emplea un objetivo de clasificación por listas de vanguardia. Al demostrar un rendimiento superior sobre DPO y SLiC, LiPO-λ muestra la clara ventaja de la optimización por listas para mejorar la alineación de LM con las preferencias humanas.

La principal innovación de LiPO-λ radica en su utilización sofisticada de datos en forma de lista. Al realizar un estudio exhaustivo de clasificación de objetivos en el marco de LiPO, la investigación destaca la eficacia de los objetivos por lista, en particular aquellos no explorados previamente en la optimización de preferencias de LM. Establece a LiPO-λ como método de referencia en este campo. La superioridad de este método es evidente en varias tareas de evaluación, estableciendo un nuevo estándar para alinear los LM con las preferencias humanas.

Profundizando en la metodología, el estudio evalúa rigurosamente el rendimiento de diferentes pérdidas de clasificación unificadas bajo el marco LiPO a través de análisis comparativos y estudios de ablación. Estos experimentos subrayan la notable capacidad de LiPO-λ para aprovechar los datos de preferencias por listas, proporcionando un medio más eficaz para alinear los LM con las preferencias humanas. Si bien los métodos existentes por pares se benefician de la inclusión de datos por listas, LiPO-λ, con su enfoque inherente por listas, aprovecha estos datos de manera más sólida, sentando una base sólida para futuros avances en el entrenamiento y la alineación de LM.

Esta investigación integral va más allá de la mera presentación de un nuevo marco; cierra la brecha entre la optimización de las preferencias de LM y el dominio bien establecido de Learning-to-Rank. Al presentar el marco LiPO, el estudio ofrece una nueva perspectiva sobre cómo alinear los LM con las preferencias humanas y destaca el potencial sin explotar de los datos por listas. La introducción de LiPO-λ como una herramienta potente para mejorar el rendimiento de LM abre nuevas vías para la investigación y la innovación, lo que promete implicaciones significativas para el futuro de la formación y alineación de modelos de lenguaje.

En conclusión, este trabajo logra varios hitos clave:

  • Introduce el marco de optimización de preferencias por listas, que redefine la alineación de los modelos de lenguaje con las preferencias humanas como un desafío de clasificación por listas.
  • Muestra el método LiPO-λ, una poderosa herramienta para aprovechar datos de lista para mejorar la alineación de LM y establecer nuevos puntos de referencia en el campo.
  • Une la optimización de las preferencias de LM con la rica tradición de Learning-to-Rank, ofreciendo conocimientos y metodologías novedosos que prometen dar forma al futuro del desarrollo de modelos de lenguaje.

El éxito de LiPO-λ no solo subraya la eficacia de los enfoques de lista, sino que también presagia una nueva era de investigación en la intersección de la capacitación LM y las metodologías de aprendizaje para clasificar. Este estudio impulsa el campo aprovechando la complejidad matizada de la retroalimentación humana. Prepara el escenario para futuras exploraciones que permitan desbloquear todo el potencial de los modelos lingüísticos para satisfacer las necesidades comunicativas humanas.


Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo y noticias de Google. Unirse nuestro SubReddit de 37k+ ML, 41k+ comunidad de Facebook, Canal de discordiay LinkedIn Grarriba.

Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..

No olvides unirte a nuestro Canal de telegramas


Hola, mi nombre es Adnan Hassan. Soy pasante de consultoría en Marktechpost y pronto seré aprendiz de gestión en American Express. Actualmente estoy cursando una doble titulación en el Instituto Indio de Tecnología, Kharagpur. Me apasiona la tecnología y quiero crear nuevos productos que marquen la diferencia.