HuggingFace presenta TextEnvironments: un orquestador entre un modelo de aprendizaje automático y un conjunto de herramientas (funciones de Python) que el modelo puede llamar para resolver tareas específicas

El ajuste fino supervisado (SFT), el modelado de recompensas (RM) y la optimización de políticas próximas (PPO) son parte de TRL. En esta biblioteca completa, los investigadores brindan herramientas para entrenar modelos de lenguaje transformador y modelos de difusión estable con aprendizaje por refuerzo. La biblioteca es una extensión de la colección de transformadores de Hugging Face. Por lo tanto, los modelos de lenguaje se pueden cargar directamente mediante transformadores después de haber sido entrenados previamente. Actualmente se admiten la mayoría de los diseños de decodificadores y codificadores-decodificadores. Para obtener fragmentos de código e instrucciones sobre cómo utilizar estos programas, consulte el manual o el subdirectorio ejemplos/.

Reflejos

  • Ajuste fácilmente modelos o adaptadores de lenguaje en un conjunto de datos personalizado con la ayuda de SFTTrainer, un contenedor liviano y fácil de usar para Transformers Trainer.
  • Para modificar de forma rápida y precisa los modelos de lenguaje según las preferencias humanas (Reward Modeling), puede utilizar RewardTrainer, un contenedor ligero sobre Transformers Trainer.
  • Para optimizar un modelo de lenguaje, PPOTrainer solo requiere tripletes (consulta, respuesta, recompensa).
  • En AutoModelForCausalLMWithValueHead y AutoModelForSeq2SeqLMWithValueHead se presenta un modelo de transformador con una salida escalar adicional para cada token que se puede utilizar como función de valor en el aprendizaje por refuerzo.
  • Entrene a GPT2 para que escriba críticas de películas favorables utilizando un clasificador de sentimientos BERT; implementar un RLHF completo usando sólo adaptadores; hacer que GPT-j sea menos tóxico; proporcione un ejemplo de pila-llama, etc.

¿Cómo funciona TRL?

En TRL, se entrena un modelo de lenguaje transformador para optimizar una señal de recompensa. Los expertos humanos o los modelos de recompensa determinan la naturaleza de la señal de recompensa. El modelo de recompensa es un modelo de ML que estima las ganancias de un flujo específico de resultados. La optimización de políticas próximas (PPO) es una técnica de aprendizaje por refuerzo que TRL utiliza para entrenar el modelo de lenguaje transformador. Debido a que es un método de gradiente de políticas, PPO aprende modificando la política del modelo de lenguaje transformador. La política puede considerarse una función que convierte una serie de entradas en otra.

Con PPO, un modelo de lenguaje se puede ajustar de tres maneras principales:

  • Liberar: El modelo lingüístico proporciona un posible inicio de oración en respuesta a una pregunta.
  • La evaluación puede implicar el uso de una función, un modelo, juicio humano o una combinación de estos factores. Cada par de consulta/respuesta debería, en última instancia, dar como resultado un único valor numérico.
  • El aspecto más difícil es sin duda la optimización. Las probabilidades logarítmicas de los tokens en secuencias se determinan utilizando los pares de consulta/respuesta en la fase de optimización. Para este propósito se utilizan el modelo entrenado y un modelo de referencia (a menudo el modelo previamente entrenado antes del ajuste). Una señal de recompensa adicional es la divergencia KL entre las dos salidas, que garantiza que las respuestas generadas no se alejen demasiado del modelo del lenguaje de referencia. Luego se utiliza PPO para entrenar el modelo de lenguaje operativo.

Características clave

  • En comparación con enfoques más convencionales para entrenar modelos de lenguaje transformador, TRL tiene varias ventajas.
  • Además de la creación, traducción y resumen de texto, TRL puede entrenar modelos de lenguaje transformador para una amplia gama de otras tareas.
  • Entrenar modelos de lenguaje transformador con TRL es más eficiente que técnicas convencionales como el aprendizaje supervisado.
  • La resistencia al ruido y a las entradas adversas mejora en los modelos de lenguaje transformador entrenados con TRL en comparación con los aprendidos con enfoques más convencionales.
  • TextEnvironments es una nueva característica en TRL.

TextEnvironments en TRL es un conjunto de recursos para desarrollar modelos de transformadores de lenguaje basados ​​en RL. Permiten la comunicación con el modelo de lenguaje transformador y la producción de resultados, que pueden utilizarse para ajustar el rendimiento del modelo. TRL usa clases para representar entornos de texto. Las clases de esta jerarquía representan varios contextos que involucran textos, por ejemplo, contextos de generación de texto, contextos de traducción y contextos de resumen. Varios trabajos, incluidos los que se enumeran a continuación, han empleado TRL para entrenar modelos de lenguaje transformador.

En comparación con el texto creado por modelos entrenados con métodos más convencionales, los modelos de lenguaje transformador entrenados con TRL producen una escritura más creativa e informativa. Se ha demostrado que los modelos de lenguaje transformador entrenados con TRL son superiores a aquellos entrenados con enfoques más convencionales para traducir texto de un idioma a otro. El lenguaje Transformer (TRL) se ha utilizado para entrenar modelos que pueden resumir texto de manera más precisa y concisa que los entrenados con métodos más convencionales.

Para más detalles visite la página de GitHub https://github.com/huggingface/trl

En resumen:

TRL es un método eficaz para utilizar RL para entrenar modelos de lenguaje transformador. En comparación con los modelos entrenados con métodos más convencionales, los modelos de lenguaje transformador entrenados con TRL funcionan mejor en términos de adaptabilidad, eficiencia y robustez. La capacitación de modelos de lenguaje transformador para actividades como generación, traducción y resumen de texto se puede lograr a través de TRL.


Revisar la GitHub. Todo el crédito por esta investigación va a los investigadores de este proyecto. Además, no olvides unirte. nuestro SubReddit de 32k+ ML, Comunidad de Facebook de más de 40.000 personas, Canal de discordia, y Boletín electrónicodonde compartimos las últimas noticias sobre investigaciones de IA, interesantes proyectos de IA y más.

Si te gusta nuestro trabajo, te encantará nuestra newsletter.

también estamos en Telegrama y WhatsApp.


Dhanshree Shenwai es ingeniero en informática y tiene una buena experiencia en empresas de tecnología financiera que cubren el ámbito financiero, tarjetas y pagos y banca con un gran interés en las aplicaciones de IA. Le entusiasma explorar nuevas tecnologías y avances en el mundo en evolución de hoy que facilita la vida de todos.