En este artículo, aprenderá cómo los logits, la temperatura y el muestreo topp funcionan juntos para controlar la predicción del siguiente token en modelos de lenguaje grandes.
Los temas que cubriremos incluyen:
Qué son los logits y cómo los produce la capa lineal final de un transformador. Cómo la temperatura y top-p (muestreo de núcleos) dan forma a la distribución de probabilidad utilizada para la selección de tokens. Cómo encajan estos tres componentes en un proceso secuencial que gobierna la generación de resultados de LLM.
Las estadísticas de selección de tokens: logits, temperatura y tutorial de Top-P
Introducción
Cuando los grandes modelos lingüísticos, o LLM para abreviar, producen resultados, están en juego varios criterios, que incluyen no solo la relevancia general de la respuesta, sino también la coherencia y la creatividad. Dado que en el fondo los modelos operan construyendo su respuesta palabra por palabra (o más precisamente, token por token), capturar estas propiedades deseables es una cuestión de ajustar matemáticamente las distribuciones de probabilidad de salida que gobiernan el proceso de predicción del siguiente token.
Este artículo presenta la mecánica detrás de las estrategias de decodificación LLM desde un punto de vista estadístico. En particular, exploraremos cómo las puntuaciones brutas del modelo, conocidas como logits, interactúan con otras dos configuraciones del modelo (temperatura y top-p), que son tres parámetros clave utilizados para controlar el proceso de selección de tokens.
Si bien nos centraremos en explorar lo que sucede dentro de las etapas finales de la arquitectura subyacente de los LLM, también conocida como el transformador, puede consultar este artículo si necesita una descripción general concisa de todo el proceso y el viaje realizado por los tokens de principio a fin.
Proceso de selección de tokens en LLM
¿Qué son los logits?
En las redes neuronales, las puntuaciones brutas y no normalizadas producidas (normalmente en las capas lineales finales) antes de convertirlas en probabilidades de posibles resultados (por ejemplo, clases) se conocen como logits. Si bien los logits se han utilizado desde la era de los modelos clásicos de clasificación de aprendizaje automático, como la regresión softmax, el mismo principio todavía se aplica a la capa lineal final de los modelos de transformadores. Esta capa final procesa estados ocultos, que contienen conocimiento lingüístico acumulado gradualmente sobre el texto de entrada recopilado en todo el transformador, y genera un vector de logits. ¿Cuántos? Tantos como el tamaño del vocabulario del modelo, es decir, el número de tokens posibles que el modelo puede generar.
Vea el diagrama en la parte superior, por ejemplo. Si un LLM capacitado para la traducción del inglés al español predice la siguiente palabra después de la secuencia generada “me gusta mucho” (la traducción de “Realmente me gusta”), podría generar una puntuación logit bruta de 12,5 para “viajar”, 8,2 para “jugar” y -3,1 para “dormir”. Estos valores brutos no tienen límites, lo que los hace difíciles de interpretar directamente; por lo tanto, se aplica una función softmax encima de la capa lineal final para transformar estos logits en una distribución de probabilidad estándar e interpretable sobre tokens de vocabulario, de modo que todos los valores sumen 1.
¿Qué son la temperatura y la Top-p?
Una vez que tenemos una distribución de probabilidad sobre el vocabulario objetivo, ¿los LLM simplemente eligen el token con la mayor probabilidad como el siguiente en generar? No exactamente, pero el verdadero proceso se parece mucho a ese escenario. El siguiente token se toma como muestra de la distribución, y el funcionamiento de este muestreo depende de varios parámetros de decodificación, dos de los más importantes son la temperatura y top-p.
La temperatura es un factor de escala aplicado a los logits antes del paso softmax. Una temperatura alta (por ejemplo, superior a 1) aplana las probabilidades resultantes, haciéndolas más uniformes. Como resultado, aumentan la incertidumbre y la imprevisibilidad y el modelo se comporta de manera más creativa. Una temperatura baja (por ejemplo, muy por debajo de 1) agudiza las diferencias entre los tokens de alta y baja probabilidad, aumentando la certeza y favoreciendo fuertemente a los tokens más probables en la distribución original. Puede encontrar más información sobre la temperatura en este artículo relacionado. Top-p, también llamado muestreo de núcleos, es otro método para controlar la aleatoriedad de la selección del siguiente token. En lugar de escalar las probabilidades, limita el grupo de candidatos para tomar muestras. Mientras que estrategias similares como top-k consideran solo los k tokens de mayor probabilidad, top-p identifica el conjunto más pequeño de tokens cuya probabilidad acumulada alcanza o excede un umbral p, lo que lo hace más adaptable y flexible. En otras palabras, si establecemos p=0,9, top-p clasifica los tokens por probabilidad y continúa agregándolos a un grupo de candidatos hasta que su probabilidad acumulada alcance 0,9.
El tutorial completo: ¿Cómo se relacionan estos conceptos entre sí?
El cálculo de logit a probabilidad, la temperatura y el top-p se pueden combinar en un proceso secuencial de varios pasos para producir resultados de LLM, es decir, predicciones del siguiente token.
Primero, el modelo genera logits sin procesar para todos los tokens posibles, como se describió anteriormente. Luego, la temperatura entra en escena al escalar estos logits sin procesar; tenga en cuenta que esto sucede antes de que la función softmax los convierta en probabilidades. Dependiendo del valor de la temperatura, la distribución resultante parecerá más uniforme (alta temperatura, más incertidumbre) o más nítida (baja temperatura, mayor certeza).
Tutorial de selección de tokens basado en logits, temperatura y top-p
Una vez que los logits escalados se convierten en probabilidades, se aplica top-p para filtrar la distribución resultante, calculando las probabilidades acumuladas para retener solo un “grupo de núcleos” central de los tokens más probables (consulte el paso 3 en la imagen de arriba). Finalmente, el modelo toma muestras aleatoriamente de ese grupo para seleccionar el siguiente token.
Comentarios finales
Ahora que hemos desmitificado el proceso estadístico detrás de la selección de tokens en los LLM, es útil considerar cómo elegir los valores de temperatura y topp en la práctica. Como desarrollador, querrás definir el equilibrio adecuado entre previsibilidad y creatividad para tu caso de uso. Para escenarios fácticos de alto riesgo, como la codificación o el análisis legal, se recomienda una temperatura baja y un p máximo más estricto (por ejemplo, t=0,1 y p=0,5), lo que produce respuestas del modelo altamente deterministas. Para dominios creativos como la generación de poesía o la lluvia de ideas, una temperatura más alta y un p superior, como t=0,8 y p=0,95, permiten una variedad más rica de tokens candidatos en el grupo de selección.