Comprender la evolución de ChatGPT: Parte 2: GPT-2 y GPT-3 | de Shirley Li | enero de 2025

El cambio de paradigma hacia eludir el ajuste fino

en nuestro artículo anteriorrevisamos los conceptos centrales de GPT-1, así como lo que lo había inspirado. Al combinar el preentrenamiento de modelado de lenguaje autorregresivo con el Transformer solo decodificador, GPT-1 había revolucionado el campo de la PNL y hecho preentrenamiento más ajuste un paradigma estándar.

Pero OpenAI no se detuvo ahí.

Más bien, mientras intentaban comprender por qué el entrenamiento previo del modelo de lenguaje de Transformers es efectivo, comenzaron a notar los comportamientos de disparo cero de GPT-1, donde a medida que avanzaba el entrenamiento previo, el modelo pudo mejorar constantemente su desempeño en las tareas. que no había sido ajustado, lo que demuestra que el entrenamiento previo podría mejorar su capacidad de disparo cero, como se muestra en la siguiente figura:

Figura 1. Evolución del rendimiento de disparo cero en diferentes tareas en función de las actualizaciones previas al entrenamiento de LM. (Imagen del Papel GPT-1.)

Esto motivó el cambio de paradigma de “preentrenamiento más ajuste” a “sólo preentrenamiento”o en otras palabras, un modelo preentrenado independiente de la tarea que puede manejar diferentes tareas sin afinar.

Tanto GPT-2 como GPT-3 están diseñados siguiendo esta filosofía.

¿Pero por qué, podría preguntarse, no es el preentrenamiento más ajuste magia ¿Funciona bien? ¿Cuáles son los beneficios adicionales de evitar la etapa de ajuste?

Limitaciones del ajuste fino

El ajuste fino funciona bien para algunas tareas bien definidas, pero no para todas, y el problema es que hay numerosas tareas en el dominio de la PNL con las que nunca hemos tenido la oportunidad de experimentar todavía.

Para esas tareas, el requisito de una etapa de ajuste significa que necesitaremos recopilar un conjunto de datos de ajuste de tamaño significativo para cada nueva tarea individual, lo que claramente no es ideal si queremos que nuestros modelos sean verdaderamente inteligentes algún día.

Mientras tanto, en algunos trabajos, los investigadores han observado que existe un riesgo cada vez mayor de explotar correlaciones espurias en los datos de ajuste a medida que los modelos que utilizamos se vuelven cada vez más grandes. Esto crea una paradoja: el modelo debe ser lo suficientemente grande para que pueda absorber tanta información como sea posible durante el entrenamiento, pero ajustar un modelo tan grande en un conjunto de datos pequeño y estrechamente distribuido hará que tenga dificultades cuando se generalice a fuera de distribución. muestras.

Otra razón es que, como humanos, no necesitamos grandes conjuntos de datos supervisados ​​para aprender la mayoría de las tareas del lenguaje, y si queremos que nuestros modelos sean útiles algún día, nos gustaría que también tuvieran esa fluidez y generalidad.

Ahora bien, tal vez la verdadera pregunta sea: ¿qué podemos hacer para lograr ese objetivo y evitar el ajuste?

Antes de profundizar en los detalles de GPT-2 y GPT-3, primero echemos un vistazo a los tres elementos clave que han influido en el diseño de su modelo: el aprendizaje independiente de la tarea, la hipótesis de escala y el aprendizaje en contexto.

Aprendizaje independiente de la tarea

Aprendizaje independiente de la tarea, también conocido como Metaaprendizaje o Aprendiendo a aprenderse refiere a un nuevo paradigma en el aprendizaje automático en el que el modelo desarrolla un amplio conjunto de habilidades en el momento del entrenamiento y luego utiliza estas habilidades en el momento de la inferencia para adaptarse rápidamente a una nueva tarea.

Por ejemplo, en MAML (Metaaprendizaje independiente del modelo), los autores demostraron que los modelos podían adaptarse a nuevas tareas con muy pocos ejemplos. Más específicamente, durante cada bucle interno (resaltado en azul), el modelo primero toma una muestra de una tarea de un conjunto de tareas y realiza algunos pasos de descenso de gradiente, lo que da como resultado un modelo adaptado. Este modelo adaptado se evaluará en la misma tarea en el bucle exterior (resaltado en naranja) y luego la pérdida se utilizará para actualizar los parámetros del modelo.

Figura 2. Metaaprendizaje independiente del modelo. (Imagen del papel MAML)

MAML muestra que el aprendizaje podría ser más general y más flexible, lo que se alinea con la dirección de evitar el ajuste en cada tarea individual. En la siguiente figura, los autores de GPT-3 explicaron cómo esta idea se puede extender a modelos de lenguaje de aprendizaje cuando se combina con el aprendizaje en contexto, con el bucle externo iterando a través de diferentes tareas, mientras que el bucle interno se describe usando aprendizaje en contextoque se explicará con más detalle en secciones posteriores.

Figura 3. Metaaprendizaje del modelo de lenguaje. (Imagen de Papel GPT-3)

La hipótesis de la escala

Como quizás la idea más influyente detrás del desarrollo de GPT-2 y GPT-3, la hipótesis de la escala se refiere a las observaciones de que al entrenar con datos más grandes, los modelos grandes podrían de alguna manera desarrollar nuevas capacidades automáticamente sin supervisión explícita, o en otras palabras, emergente Las habilidades podrían ocurrir al ampliar, tal como lo vimos en las habilidades de disparo cero del GPT-1 previamente entrenado.

Tanto GPT-2 como GPT-3 pueden considerarse experimentos para probar esta hipótesis, con GPT-2 configurado para probar si un modelo más grande previamente entrenado en un conjunto de datos más grande podría usarse directamente para resolver tareas posteriores, y GPT-3. 3 está listo para probar si el aprendizaje en contexto podría aportar mejoras con respecto a GPT-2 cuando se amplíe aún más.

Discutiremos más detalles sobre cómo implementaron esta idea en secciones posteriores.

Aprendizaje en contexto

Como mostramos en la Figura 3, en el contexto de los modelos de lenguaje, el aprendizaje en contexto se refiere al bucle interno del proceso de metaaprendizaje, donde el modelo recibe una instrucción en lenguaje natural y algunas demostraciones de la tarea en el momento de la inferencia. y luego se espera que complete esa tarea descubriendo automáticamente los patrones en las demostraciones dadas.

Tenga en cuenta que el aprendizaje en contexto ocurre en la fase de prueba. sin actualizaciones de gradiente realizadasque es completamente diferente del ajuste tradicional y más similar a cómo los humanos realizan nuevas tareas.

En caso de que no esté familiarizado con la terminología, demostraciones generalmente significa pares de entrada-salida ejemplares asociados con una tarea en particular, como mostramos en el “ejemplos” parte en la siguiente figura:

Figura 4. Ejemplo de aprendizaje en contexto de pocas oportunidades. (Imagen de Papel GPT-3)

La idea del aprendizaje en contexto se exploró implícitamente en GPT-2 y luego de manera más formal en GPT-3, donde los autores definieron tres configuraciones diferentes: disparo cero, disparo único y pocos disparos, dependiendo de cuántas demostraciones se realicen. dado al modelo.

Figura 5. Aprendizaje en contexto de disparo cero, de un disparo y de pocos disparos, en contraste con el ajuste fino tradicional. (Imagen de Papel GPT-3)

En breve, El aprendizaje independiente de la tarea resalta el potencial de evitar el ajuste fino, mientras que la hipótesis de escala y el aprendizaje en contexto sugieren un camino práctico para lograrlo.

En las siguientes secciones, analizaremos más detalles para GPT-2 y GPT-3, respectivamente.