¿Podemos superar la fragilidad rápida en modelos de lenguaje grandes?  Google AI presenta la calibración por lotes para mejorar el rendimiento

Los grandes modelos de lenguaje han surgido recientemente como herramientas poderosas para diversas tareas de clasificación de imágenes y comprensión del lenguaje natural. Sin embargo, estos LLM enfrentan desafíos, particularmente en relación con la fragilidad rápida y los múltiples sesgos en la entrada. Estos sesgos pueden deberse al formato, la elección de los verbalizadores y los ejemplos utilizados para el aprendizaje en contexto. Estos problemas pueden provocar una degradación inesperada del rendimiento, por lo que es imperativo abordarlos de forma eficaz.

Los esfuerzos existentes para abordar estos desafíos han dado lugar a métodos de calibración para mitigar los sesgos y recuperar el desempeño del LLM. Estos métodos han buscado una visión más unificada del problema abordando al mismo tiempo sus matices. La necesidad de tales soluciones se ve subrayada por el hecho de que los LLM son sensibles a cómo se les solicita, y sus predicciones pueden verse influenciadas por la elección de plantillas y verbalizadores, así como por el orden y el contenido de los ejemplos de ICL.

Un equipo de investigadores de Google ha propuesto un nuevo enfoque llamado Batch Calibration (BC). BC es un método sencillo pero intuitivo que apunta al sesgo contextual explícito en la entrada por lotes. A diferencia de otros métodos de calibración, BC es de tiro cero y solo se aplica durante la fase de inferencia, lo que incurre en costos computacionales adicionales mínimos. Este enfoque se puede extender a una configuración de algunas tomas, lo que le permite adaptarse y aprender sesgos contextuales a partir de datos etiquetados.

La eficacia de BC se demuestra a través de una extensa experimentación en más de diez tareas de clasificación de imágenes y comprensión del lenguaje natural. Tanto en escenarios de aprendizaje de cero intentos como de pocos intentos, BC supera las líneas de base de calibración anteriores. Su simplicidad en el diseño y la capacidad de aprender de datos etiquetados limitados lo convierten en una solución práctica para abordar la fragilidad y el sesgo rápidos en los LLM.

Las métricas obtenidas a través de estos experimentos muestran que BC ofrece un rendimiento de vanguardia, lo que lo convierte en una solución prometedora para quienes trabajan con LLM. Al mitigar el sesgo y mejorar la solidez, BC agiliza el proceso de ingeniería rápida y permite un rendimiento más eficiente y confiable de estos potentes modelos de lenguaje.

En conclusión, los desafíos de la fragilidad y los sesgos rápidos en modelos de lenguaje grandes se abordan de manera efectiva mediante métodos de calibración innovadores como la calibración por lotes (BC). Estos métodos ofrecen un enfoque unificado para mitigar el sesgo contextual y mejorar el desempeño del LLM. A medida que la comprensión del lenguaje natural y la clasificación de imágenes continúen evolucionando, soluciones como BC desempeñarán un papel vital para aprovechar todo el potencial de los LLM y al mismo tiempo minimizar el impacto de los sesgos y la fragilidad en sus respuestas.


Revisar la Papel y Blog de Google. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 31k+ ML, Comunidad de Facebook de más de 40.000 personas, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.

También estamos en WhatsApp. Únase a nuestro canal de IA en Whatsapp.


Niharika es pasante de consultoría técnica en Marktechpost. Es estudiante de tercer año y actualmente cursa su licenciatura en tecnología en el Instituto Indio de Tecnología (IIT), Kharagpur. Es una persona muy entusiasta con un gran interés en el aprendizaje automático, la ciencia de datos y la inteligencia artificial y una ávida lectora de los últimos avances en estos campos.