¿Cómo podemos elevar la calidad de los modelos de lenguaje grandes?  Conozca PIT: un marco de superación personal implícito

Los LLM han logrado resultados de vanguardia en diversas tareas complejas, como razonamiento matemático, resúmenes, conversaciones, inducción de esquemas y resolución de problemas de dominios específicos. El éxito de los LLM depende de su capacidad para seguir instrucciones y alinearse con las preferencias humanas. Sin embargo, tienen limitaciones y pueden producir información incorrecta, errores de razonamiento o contenido inútil.

Se han propuesto varios enfoques para mejorar el desempeño de los LLM, con un enfoque cada vez mayor en permitir que los LLM mejoren por sí mismos la calidad de su respuesta. Mejorar el desempeño de los LLM tradicionalmente implicaba recopilar datos de capacitación más diversos y de alta calidad a través de anotaciones humanas, un proceso que requiere muchos recursos, especialmente para dominios especializados. Los métodos basados ​​en indicaciones han ganado popularidad debido a su eficacia, eficiencia y conveniencia. Sin embargo, estos métodos normalmente requieren rúbricas detalladas como insumos, cuya creación puede ser desafiante y costosa, especialmente para objetivos de mejora complejos.

En respuesta a esta cuestión, investigadores de la Universidad de Illinois Urbana-Champaign y Google proponen el “marco de superación personal implícita (PIT)”, que permite a los LLM aprender objetivos de mejora a partir de datos de preferencias humanas sin necesidad de rúbricas explícitas. PIT aprovecha los datos de preferencias para entrenar modelos de recompensa, eliminando la necesidad de esfuerzos humanos adicionales o de recopilación de datos. La idea central de PIT es reformular el objetivo de formación del aprendizaje reforzado a partir de la retroalimentación humana (RLHF). En lugar de maximizar la calidad de la respuesta para una entrada determinada, PIT apunta a maximizar la brecha de calidad entre la respuesta y una respuesta de referencia, alineándose más estrechamente con las preferencias humanas.

Los investigadores realizaron experimentos en conjuntos de datos sintéticos y del mundo real para evaluar el rendimiento de PIT frente a métodos basados ​​en indicaciones. Sus resultados demuestran que PIT supera significativamente a las estrategias de estimulación en la mejora de la calidad de la respuesta.

La reformulación del objetivo de capacitación del RLHF por parte del PIT se centra en cerrar la brecha de calidad entre las respuestas modelo y de referencia. Este enfoque permite que PIT mejore de forma iterativa las respuestas sin rúbricas explícitas. Los experimentos con conjuntos de datos del mundo real y datos sintéticos demuestran la superioridad de PIT sobre los métodos basados ​​en indicaciones, destacando su eficacia para mejorar la calidad de la respuesta LLM.

PIT supera al método Self-Refine, que se basa en indicaciones de superación personal. Si bien el grado de mejora en comparación con Self-Refine varía según el método de evaluación (por ejemplo, evaluación humana, modelos de lenguaje de terceros, modelos de recompensa), PIT obtiene consistentemente mejores resultados en los experimentos.

El estudio también explora el impacto de los ajustes de temperatura en los métodos de superación personal, lo que indica que las temperaturas bajas producen mejores resultados con PIT. Por el contrario, las altas temperaturas son más adecuadas para Self-Refine. Además, la investigación investiga la importancia del aprendizaje por refuerzo curricular y el número de iteraciones de mejora, enfatizando la necesidad de considerar cuidadosamente las condiciones de parada en aplicaciones prácticas.

En conclusión, el marco PIT de automejora implícita ofrece una vía prometedora para mejorar el rendimiento de los modelos de lenguaje grandes. Al aprender objetivos de mejora a partir de datos de preferencias humanas, PIT aborda las limitaciones de los métodos de estimulación tradicionales y muestra su eficacia para mejorar la calidad de la respuesta LLM en diversos conjuntos de datos y condiciones.


Revisar la Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 31k+ ML, Comunidad de Facebook de más de 40.000 personas, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.


Dhanshree Shenwai es ingeniero en informática y tiene una buena experiencia en empresas de tecnología financiera que cubren el ámbito financiero, tarjetas y pagos y banca con un gran interés en las aplicaciones de IA. Le entusiasma explorar nuevas tecnologías y avances en el mundo en evolución de hoy que facilita la vida de todos.