Los modelos de lenguaje grande (LLM) son un avance significativo en PNL. Están diseñados para comprender, interpretar y generar el lenguaje humano. Estos modelos están entrenados en enormes conjuntos de datos y pueden realizar traducción, resúmenes y respuestas conversacionales. A pesar de sus capacidades, un desafío persistente es mejorar su capacidad para seguir instrucciones complejas de manera precisa y confiable. Este desafío es crucial porque el seguimiento preciso de instrucciones es fundamental para aplicaciones prácticas, desde robots de servicio al cliente hasta asistentes avanzados de IA.
Un problema crítico para mejorar las capacidades de seguimiento de instrucciones de los LLM es la dificultad para generar automáticamente datos de capacitación de alta calidad sin anotaciones manuales. Los métodos tradicionales implican que anotadores humanos diseñen instrucciones y las respuestas correspondientes, lo que requiere mucho tiempo y es difícil de escalar. Además, incluso los modelos avanzados a partir de los cuales se imita el comportamiento pueden cometer errores, lo que genera datos de entrenamiento poco confiables. Esta limitación obstaculiza el desarrollo de modelos que puedan ejecutar correctamente tareas complejas, especialmente en escenarios críticos donde los errores pueden tener consecuencias importantes.
Los métodos actuales para mejorar la capacidad de seguir instrucciones incluyen la anotación manual y la imitación de comportamiento. La anotación manual requiere un gran esfuerzo humano para crear instrucciones diversas y complejas, lo cual supone un desafío debido a las limitaciones de la cognición humana. La imitación de comportamiento, por otro lado, implica entrenar modelos para imitar las respuestas de los LLM más avanzados. Sin embargo, este enfoque restringe los nuevos modelos a las capacidades de los modelos originales y no garantiza la precisión. Si bien los modelos potentes y avanzados como GPT-4 no son infalibles, los errores en sus respuestas pueden propagarse a nuevos modelos, reduciendo su confiabilidad.
Investigadores de Alibaba Inc. han presentado AUTOSI, un método novedoso diseñado para abordar estos desafíos generando automáticamente datos de entrenamiento que siguen instrucciones. AUTOIF transforma el proceso de validación en verificación de código, lo que requiere que los LLM creen instrucciones, el código correspondiente para verificar la exactitud de la respuesta y muestras de pruebas unitarias para verificar el código. Este enfoque aprovecha el muestreo de rechazo basado en retroalimentación de ejecución para generar datos adecuados para el ajuste fino supervisado (SFT) y el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF). Al automatizar estos pasos, AUTOIF elimina la necesidad de anotaciones manuales, lo que hace que el proceso sea escalable y confiable.
La idea central de AUTOIF implica tres componentes principales: generar instrucciones verificables, crear códigos de verificación y garantizar la confiabilidad. El método comienza con un pequeño conjunto de instrucciones iniciales escritas a mano, ampliadas con LLM para producir instrucciones diversas. Luego se generan códigos de verificación y casos de prueba unitaria para cada instrucción. Si una instrucción no se puede verificar mediante código, se descarta. El proceso incluye generar respuestas que aprueban o no el código de verificación, que luego se utilizan para crear datos de entrenamiento. Este método garantiza que solo se utilicen datos de alta calidad para la capacitación, lo que mejora significativamente las capacidades de seguimiento de instrucciones de los LLM.
El rendimiento de AUTOIF ha sido probado rigurosamente y muestra mejoras sustanciales en varios puntos de referencia. Aplicado a LLM de código abierto como Qwen2-72B y LLaMA3-70B, AUTOIF logró tasas de precisión de instrucciones sueltas de hasta el 90,4 % en el punto de referencia IFEval, marcando el primer caso en el que se supera el 90 % de precisión. En el benchmark FollowBench, los modelos mostraron mejoras significativas, con aumentos promedio de más del 5% en la métrica SSR. Además, AUTOIF permitió a Qwen2-7B y LLaMA3-8B lograr ganancias de rendimiento promedio de más del 4% en ambos puntos de referencia. Reemplazar Qwen2-72B y LLaMA3-70B con GPT-4 resultó en más mejoras. Los investigadores también han abierto los conjuntos de datos SFT y DPO construidos utilizando AUTOIF en Qwen2-72B, lo que representa el primer conjunto de datos de seguimiento de instrucciones complejas de código abierto a una escala de decenas de miles.

En conclusión, AUTOIF representa un avance significativo en la mejora de las capacidades de seguimiento de instrucciones de modelos de lenguaje grandes. La automatización de la generación y verificación de datos de seguimiento de instrucciones aborda los problemas de escalabilidad y confiabilidad de los métodos anteriores. Este enfoque innovador garantiza que los modelos puedan ejecutar con precisión tareas complejas, lo que los hace más efectivos y confiables en diversas aplicaciones. Las pruebas exhaustivas y las mejoras notables en los puntos de referencia resaltan el potencial de AUTOIF para transformar el desarrollo de los LLM. Los investigadores han demostrado que AUTOIF puede lograr capacidades de seguimiento de instrucciones confiables, escalables y de alta calidad, allanando el camino para aplicaciones de IA más avanzadas y prácticas.
Revisar la Papel y GitHub. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides seguirnos en Gorjeo.
Únete a nuestro Canal de telegramas y LinkedIn Grarriba.
Si te gusta nuestro trabajo, te encantará nuestro Boletin informativo..
No olvides unirte a nuestro SubReddit de más de 45.000 ml
🚀 Cree, edite y aumente datos tabulares con el primer sistema de IA compuesto, Gretel Navigator, ¡ahora disponible de forma generalizada! [Advertisement]
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.