Este artículo de IA presenta DPO y ORPO diversificados: métodos posteriores a la capacitación para aumentar la diversidad de resultados en la escritura creativa con LLMS

La escritura creativa es un dominio que prospera en la diversidad y la imaginación. A diferencia de la escritura basada en hechos o específica de la tarea, donde puede existir una sola salida correcta, la escritura creativa implica numerosas respuestas válidas a un aviso. Las historias, poemas y narraciones pueden ramificarse en innumerables direcciones, cada una con sabor y significado estilísticos. Esta inherente mentalidad abierta hace que la escritura creativa sea un desafío principal para los sistemas de IA, que necesitan mantener la coherencia narrativa al tiempo que produce resultados novedosos y distintos.

El problema central radica en cómo se refinan los modelos de idiomas grandes después de su capacitación inicial. Los métodos posteriores a la capacitación a menudo enfatizan las mejoras de calidad al alinear las respuestas con las preferencias del usuario o maximizar los puntajes de recompensas. Sin embargo, estos ajustes inadvertidamente hacen que los modelos produzcan respuestas que son demasiado similares en las indicaciones. En entornos creativos, esto lleva a una caída notable en la diversidad de salida. La falta de variación limita el poder expresivo del modelo, lo que resulta en historias uniformes o construcciones de oraciones similares, incluso cuando las indicaciones son muy diferentes.

Las soluciones anteriores intentaron abordar esto ajustando métodos de decodificación o estrategias inmediatas. Los investigadores utilizaron el ajuste de la temperatura de muestreo, el filtrado Top-K o Top-P, o la solicitud iterativa para introducir aleatoriedad. Algunos exploraron métodos, como modificaciones de búsqueda de haz o autocritaje, para fomentar respuestas alternativas. Si bien estos ayudaron a diversificar los resultados, a menudo tenían un costo, sacrificando la calidad general de la respuesta, aumentando el tiempo de generación o la introducción de inconsistencias en el tono y la gramática. Más crucialmente, no adoptaron el proceso de capacitación central del modelo para aprender de diversas muestras.

Investigadores de Midjourney y la Universidad de Nueva York propusieron un ajuste novedoso durante la fase posterior al entrenamiento. Introducieron “DPO diversificado” y “ORPO diversificado”, versiones cambiadas de dos técnicas de optimización basadas en preferencias populares. Su innovación estaba incorporando un puntaje de desviación, cuantificando cuánto difiere un ejemplo de capacitación de otros que responden al mismo aviso. Las respuestas raras y diversas tienen más importancia durante el aprendizaje al usar este puntaje para las pérdidas de entrenamiento con pesas. Los investigadores implementaron específicamente estas estrategias en grandes modelos como Meta’s Llama-3.1-8b y Mistral-7B utilizando el ajuste fino de los parámetros a través de Lora.

En este enfoque, la desviación actúa como una señal de aprendizaje. Para cada par de entrenamiento de una respuesta mejor y peor a un aviso, la desviación de la mejor respuesta se calcula utilizando integridades semánticas y estilísticas. Estas incrustaciones miden no solo las diferencias de contenido sino también la singularidad estilística entre las respuestas. El puntaje resultante luego influye en cuánto contribuye ese par de entrenamiento a las actualizaciones de peso del modelo. Este método aumenta la probabilidad de que el modelo genere resultados distintos pero de alta calidad. La capacitación utilizó más de 400,000 pares de respuesta rápida con votos ascendentes de Reddit como señales de calidad e introdujo métodos de mezcla para equilibrar efectivamente las desviaciones semánticas y de estilo.

Los resultados cuantitativos demostraron el éxito del método propuesto. El modelo de mejor rendimiento, Llama-3.1-8b con DPO diversificado que usa desviación semántica y de estilo (DDPO-BOTH), logró casi la misma puntuación de recompensa que GPT-4O, al tiempo que lo superó significativamente en la diversidad. Específicamente, el modelo tenía una diversidad semántica que se acercaba al del conjunto de datos de referencia hechos humanos y la diversidad de estilo ligeramente debajo de él. En las evaluaciones humanas cara a cara, el 68% de los revisores prefirieron los resultados de DDPO-BOTH sobre GPT-4O para la calidad, y el 100% los eligió como más diversos. En comparación con la línea de base DPO, DDPO-Both todavía salió adelante, seleccionó el 50% del tiempo para la calidad y el 62% de la diversidad. Cuando se disponía de menos respuestas por solicitud durante el entrenamiento, se mitigaron ligeras caídas en las puntuaciones de recompensas utilizando un umbral de desviación mínimo o un muestreo de respuestas de mayor calidad.

Esta investigación destacó una solución convincente a la compensación de calidad de diversidad en la escritura creativa generada por IA. Al enfatizar la desviación en la capacitación, los investigadores permitieron que los modelos valoren la singularidad sin comprometer la coherencia. El resultado es un modelo que ofrece narraciones más ricas y variadas, marcando un paso significativo en el desarrollo creativo de IA.


Verificar el Papel. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro 85k+ ml de subreddit.


Nikhil es consultor interno en MarktechPost. Está buscando un doble grado integrado en materiales en el Instituto Indio de Tecnología, Kharagpur. Nikhil es un entusiasta de AI/ML que siempre está investigando aplicaciones en campos como biomateriales y ciencias biomédicas. Con una sólida experiencia en la ciencia material, está explorando nuevos avances y creando oportunidades para contribuir.