NVIDIA presenta X-Token: KD con tokenizador cruzado guiado por proyección que supera a GOLD en +3,82 puntos promedio en Llama-3.2-1B

La destilación de conocimiento (KD) transfiere “conocimiento oscuro” de un modelo de maestro grande a un estudiante más pequeño. El estudiante aprende de la distribución de probabilidad de salida completa del maestro sobre las fichas, no solo de las respuestas correctas. Esto se hace mediante la divergencia Kullback-Leibler (KL) por posición sobre las distribuciones de probabilidad del siguiente token.

Esta formulación requiere un tokenizador compartido. Un practicante comprometido con Llama-3.2-1B no puede aprovechar maestros más fuertes con tokenizadores incompatibles, como Phi-4-mini o Qwen3-4B, porque las posiciones de los tokens no se corresponden entre los vocabularios. Esto también evita la destilación de múltiples maestros entre familias de tokenizadores.

Los investigadores de NVIDIA presentaron X-Token, un método basado en distribución logit para KD (destilación de conocimientos) de tokenizadores cruzados. Funciona como un reemplazo directo de la pérdida de KD estándar, y no requiere componentes auxiliares entrenables ni cambios arquitectónicos.

El problema que X-Token está resolviendo

Dos enfoques anteriores dominan el KD con tokenizador cruzado. ULD (Universal Logit Distillation) evita la alineación de vocabulario ordenando ambas distribuciones por rango y minimizando la distancia L1. Descarta por completo la identidad del token. GOLD agrega alineación de tramos y una pérdida híbrida. Divide los tokens en un subconjunto común de coincidencia de cadenas 1 a 1, entrenado con divergencia KL, y un resto poco común, entrenado con coincidencia de rangos estilo ULD. GOLD es el estado actual del arte.

El equipo de investigación identifica dos fallos estructurales en el diseño de GOLD:

Fallo 1: Fallo de token poco común: cuando los tokenizadores fragmentan el texto de manera diferente, los tokens críticos caen en el subconjunto poco común inigualable. Llama-3 incluye números de varios dígitos como tokens individuales: "201" es un token. Qwen3 los divide dígito por dígito: “2”, “0”, “1”. Bajo ORO, los 1100 números de dos y tres dígitos de Llama (100 de dos dígitos, 1000 de tres dígitos) caen en el conjunto poco común cuando Qwen3-4B es el maestro. Esos tokens reciben dos tipos de señales dañinas: ruido independiente de la identidad de la coincidencia ULD basada en rangos y gradientes supresores del término KL común que actúa a través del softmax de vocabulario completo. El resultado: la precisión de GSM8k cae a 2,56 bajo GOLD con Qwen3-4B, en comparación con 12,89 para KD con el mismo tokenizador de un maestro Llama-3.2-3B más débil.

Fallo 2: Coincidencia excesivamente conservadora: GOLD utiliza una estricta igualdad de cadenas para definir el subconjunto común. Un token de estudiante Hundreds corresponde a tokens de maestro Hund seguidos de rojos bajo la re-tokenización del lado del maestro, pero la coincidencia estricta descarta este par. La señal de alineación útil se pierde incluso cuando la correspondencia está bien formada.

Estos dos fallos requieren remedios opuestos: eliminar la partición cuando los tokens críticos estén desalineados y relajarla cuando la alineación sea estructuralmente sólida.

Cómo funciona X-Token

X-Token tiene tres componentes: alineación de tramo, una matriz de proyección W y dos formulaciones de pérdida complementarias: P-KL y H-KL.

Alineación del tramo

Los tokenizadores de profesores y estudiantes producen secuencias de diferentes longitudes para el mismo texto. X-Token utiliza alineación de intervalo de programación dinámica (DP), agrupando tokens en fragmentos donde cada par de fragmentos se decodifica en la misma subcadena de texto subyacente. Luego, una fusión de reglas de cadena combina probabilidades por token dentro de cada fragmento en una única distribución a nivel de fragmento para usar en la pérdida por destilación. La alineación se almacena en caché por secuencia y no agrega sobrecarga de entrenamiento por paso.

El equipo de investigación también identifica una falla en la alineación superficie-subcadena de TRL, que se utiliza en el entrenador GOLD de TRL. TRL acumula buffers decodificados por lado y los vacía solo cuando ambos buffers coinciden como cadenas sin formato iguales. Un desacuerdo a nivel de bytes, como el antecedente automático de Llama-3 mientras que Qwen-3 no, evita descargas futuras y obliga a todos los tokens restantes a formar parte de un supergrupo mal agrupado al final de la secuencia. El enfoque DP maneja esto con un único movimiento de espacio, independientemente de la longitud de la secuencia.

La matriz de proyección W

Después de la alineación, las distribuciones de profesores y estudiantes aún operan en diferentes vocabularios. La matriz de proyección W ∈ ℝVS|×|VT| asigna cada ficha de estudiante a una combinación ponderada de fichas de maestro, salvando la discrepancia de vocabulario.

W se construye de manera determinista en dos pasadas:

Paso 1 (coincidencia exacta): para cada par (token de estudiante, token de maestro) cuyas cadenas decodificadas coincidan después de la canonicalización, establezca W[s, t] = 1. La canonicalización unifica prefijos de espacio (Ġ, _, ␣), nuevas líneas, tokens de respaldo de bytes de la forma <0xHH> y tokens especiales específicos del modelo en todas las familias de tokenizadores.

Paso 2 (regla de múltiples tokens): para cada token de estudiante sin una coincidencia exacta, vuelva a tokenizar su texto decodificado en el tokenizador del maestro. Si la secuencia resultante tiene una longitud ≤ 4, asigne pesos decaídos exponencialmente: W[s, τᵢ] = β·γⁱ con (β, γ) = (0,9, 0,1). Un tramo de longitud 2 recibe pesos normalizados (0,909, 0,091). Un tramo de longitud 3 recibe (0,9009, 0,0901, 0,0090). Un tramo de longitud 4 recibe (0,9000, 0,0900, 0,0090, 0,0009). El subtoken principal recibe el peso más alto porque normalmente tiene la masa de probabilidad más informativa, por ejemplo, "_inter" en ["_inter", "national"] o "_20" en ["_20", "24"].

Cada fila se trunca a sus 4 entradas principales y se normaliza por fila. Debido a que cada fila de W no es negativa y suma 1, la multiplicación por la izquierda por W⊤ preserva la probabilidad: si pS es un vector de probabilidad, W⊤pS también es un vector de probabilidad válido sobre VT. W se construye una vez antes del entrenamiento y opcionalmente se puede perfeccionar conjuntamente con el estudiante bajo P-KL.

P-KL: Abordar gradientes erróneos y supresivos

P-KL elimina la partición por completo. Proyecta la distribución de los estudiantes p̂S(k) en el espacio de vocabulario del profesor a través de W:

p~S(k)

Luego calcula la divergencia KL directamente entre el profesor y el estudiante proyectado:

∂ℒcomún∂zj=pS[j]⋅M𝒞(T)frac{partialmathcal{L}_{común}}{partial z_{j}} = p_S[j] cdot M_{mathcal{C}}(T)

No existe un conjunto poco común, por lo que se elimina el ruido ULD basado en rangos. El problema del gradiente supresor también se elimina: la proyección dirige la masa de probabilidad del estudiante para "201" directamente a {2, 0, 1} en el vocabulario del profesor a través de W.

El equipo de investigación demuestra formalmente (Proposición 1) que el término KL común de GOLD induce gradientes no negativos en cada logit de estudiante poco común. El gradiente en un logit j de estudiante poco común es: ∂ℒcommon/∂zj = pS[j] · MC(T), donde MC(T), es la masa de probabilidad del maestro en el subconjunto común. Bajo el descenso de gradiente, esto siempre hace que zj baje, suprimiendo la probabilidad de cada token poco común, independientemente del token de verdad fundamental.

H-KL: Relajando el emparejamiento 1 a 1

H-KL se aplica cuando la partición es estructuralmente sólida, es decir, cuando los tokens críticos caen en el subconjunto común. En ese caso, el KL directo de GOLD sobre pares alineados con la identidad ofrece una supervisión por par más nítida que la proyección de P-KL, que combina la masa de probabilidad de los estudiantes en múltiples tokens de maestros. La oportunidad es hacer que la partición sea menos despilfarradora relajando el estricto criterio de igualdad de cadenas.

H-KL conserva la estructura de pérdida híbrida de GOLD pero expande el conjunto común C usando W. Para cada token de estudiante s, selecciona el token de maestro mejor clasificado t* = argmax_{t'∈V_T} W[s, t'] y agrega (s, t*) a C. Las coincidencias exactas se conservan ya que reciben el peso 1 en W, el más alto posible. Ahora se admiten pares casi equivalentes como (Cientos, Hund), excluidos por GOLD. El C expandido alimenta la misma pérdida híbrida: KL directo en pares comunes, ULD en el resto.

Seleccionar entre P-KL y H-KL

La selección utiliza una auditoría de cobertura de categorías simbólicas en el vocabulario de los estudiantes. Para las tareas matemáticas, los números de varios dígitos son la categoría crítica. La Tabla 8 en el trabajo de investigación muestra: bajo Qwen3-4B, 0 de 100 números de Llama de dos dígitos y 0 de 1000 números de Llama de tres dígitos aparecen en C. Bajo Phi-4-mini-Instruct, los 100 números de dos dígitos y los 1000 de tres dígitos aparecen en C. La puntuación ASCII y los números de un solo dígito están completamente cubiertos en ambos casos.

https://arxiv.org/pdf/2605.21699

La regla: use P-KL cuando las fichas críticas queden fuera de C (Qwen3-4B) y H-KL cuando la partición sea sólida (Phi-4-mini-Instruct). La Tabla 2 del artículo de investigación muestra que la inversión de modo es marcada: P-KL supera a H-KL en un promedio de +3,55. en Qwen3-4B, mientras que H-KL supera a P-KL en un promedio de +1,68. en Phi-4-mini.

https://arxiv.org/pdf/2605.21699

Destilación de varios profesores

X-Token se extiende a varios profesores. Cada profesor tiene su propia matriz de proyección W_m y selección de pérdidas. Para los profesores con el mismo tokenizador, se utiliza KL de nivel de token estándar. La pérdida de varios docentes agrega las pérdidas por docente con pesos αm:

ℒKD,multi=∑m=1Mαm1|𝒦m|∑k∈𝒦mℒ∗,m(k)mathcal{L}_{KD,multi} = sum_{m=1}^{M}alpha_{m}frac{1}{|mathcal{K}_{m}|}sum_{kinmathcal{K}_{m}}mathcal{L}_{*,m}^{(k)}

El equipo de investigación evalúa esquemas de ponderación estáticos y adaptativos de la confianza. Las variantes adaptativas de la confianza calculan α_m a partir de la entropía cruzada, la entropía de Shannon o la probabilidad máxima prevista de la distribución del profesor. La ponderación estática supera a los esquemas adaptativos en ambas configuraciones de varios profesores evaluadas.

https://arxiv.org/pdf/2605.21699

Escalado dinámico KD/CE

El entrenamiento combina la pérdida por destilación ℒKD con la entropía cruzada del siguiente token ℒCE. Debido a que estos términos difieren en magnitud y cambios durante el entrenamiento, X-Token reescala el término KD en cada paso para que coincida con la escala de ℒCE:

ℒ=sg(ℒCE/ℒKD)⋅ℒKD+ℒCEmathcal{L} = text{sg}(mathcal{L}_{CE} / mathcal{L}_{KD}) cdot mathcal{L}_{KD} + mathcal{L}_{CE}

donde sg(·) es gradiente de parada. La Tabla 4 del artículo muestra que el escalado dinámico supera a tres configuraciones de peso fijo (KD-pesado, equilibrado, CE-pesado) en el par Qwen3-4B (P-KL).

https://arxiv.org/pdf/2605.21699

Experimentos y resultados

Estudiante: Llama-3.2-1B. Profesores: Llama-3.2-3B (mismo tokenizador), Qwen3-4B y Phi-4-mini-Instruct. Datos de entrenamiento: conjunto de datos NemotronClimbMix, 30.000 pasos, tamaño de lote 768, longitud de contexto 4096. Optimizador: AdamW, tasa de aprendizaje 5×10⁻⁵, 5% de calentamiento con caída del coseno, caída de peso 0,1, recorte de gradiente 1,0. Cada experimento es factible en una única GPU NVIDIA H100; El equipo de investigación utilizó 128 H100 para acelerar la iteración.

Evaluación: Precisión de 3 disparos en MMLU, GSM8k, MATH-Hendrycks, Winogrande y HellaSwag.

Resultados clave:

ConfiguraciónMétodoPromedioSin destilaciónLlama-1B (base)33.96Sin destilaciónPreentrenamiento continuo36.63Mismo tokenizadorLlama-3B → 1B (KL)38.40Tokenizador cruzadoQwen-4B, ULD36.77Tokenizador cruzadoQwen-4B, GOLD35.03Tokenizador cruzadoQwen-4B, X-Token (P-KL)38.85Tokenizador cruzadoPhi-mini, ULD38.31Tokenizador cruzadoPhi-mini, GOLD38.66Tokenizador cruzadoPhi-mini, X-Token (H-KL)39.18MultiprofesorPhi-mini + Llama-3B (X-Token)40.48

En Qwen-4B (régimen P-KL): GOLD alcanza una media de 35,03, por debajo incluso de la formación previa continuada sin profesor (36,63). Esto confirma que la partición es activamente dañina cuando los tokens críticos están desalineados. Pure ULD (36.77) ya mejora con respecto a GOLD, lo que indica que la partición es la principal fuente de falla. P-KL mejora aún más hasta un promedio de 38,85. (+3,82 sobre ORO). Solo GSM8k pasa de 2,56 a 15,54, superando el KD del mismo tokenizador de Llama-3.2-3B (12,89) en ese punto de referencia.

En Phi-mini (régimen H-KL): el ORO alcanza el 38,66 de media. — una línea de base razonable en la que la partición sea estructuralmente sólida. H-KL mejora a 39,18 de media. (+0,52 sobre ORO). P-KL aplicado a Phi-mini cae a 37,50 en promedio, lo que confirma que el modo de pérdida incorrecto perjudica incluso cuando W está disponible.

Multiprofesor: Phi-mini (H-KL, α=0,8) + Llama-3B (KL estándar, α=0,2) bajo ponderación estática alcanza un promedio de 40,48. Esto es +2,08 sobre el KD de la misma familia de Llama-3B solo, y +1,30 sobre el mejor resultado de tokenizador cruzado único (39,18). La combinación de Phi-mini + Qwen-4B (dos profesores con puntos fuertes de razonamiento superpuestos) obtiene una puntuación de sólo 38,49, por debajo del mejor profesor individual. Agregar a Qwen-4B como tercer maestro produce 40,15, con matemáticas/razonamiento degradantes (GSM8k 20,39 → 19,18), mientras que el sentido común mejora ligeramente. La complementariedad docente, no el número de docentes, impulsa los avances.

Fortalezas y qué observar

Fortalezas:

El problema del gradiente supresor en la pérdida híbrida de GOLD se prueba formalmente (Proposición 1), no solo se observa empíricamente. W se construye basándose en reglas únicamente a partir de cadenas de tokenizadores; no se necesitan datos de entrenamiento ni parámetros aprendidos en la inicialización. El escalado dinámico KD/CE elimina la necesidad de ajustar los pesos de pérdida fijos; supera a tres líneas base de peso fijo en ablaciones. La extensión para varios maestros no agrega cambios arquitectónicos; cada profesor utiliza su propio W_m y su pérdida adecuada. La auditoría de cobertura para la selección de P-KL frente a H-KL es un criterio definido y reproducible basado en la retención de tokens por categoría en C.

Qué mirar:

Los experimentos utilizan únicamente Llama-3.2-1B como estudiante bajo entrenamiento previo continuo; los estudiantes más grandes y los entornos adaptados a la instrucción no se evalúan. Sólo se evalúan tres parejas de maestros; las familias de tokenizadores de baja superposición (SentencePiece, BPE de nivel de byte) se dejan para trabajos futuros. La ponderación estática supera la ponderación adaptativa de confianza en todas las configuraciones de múltiples profesores probadas, pero ¿por qué? La regla de múltiples tokens en el Paso 2 omite los tokens de los estudiantes cuyo texto decodificado se vuelve a tokenizar en secuencias de más de 4 bajo el maestro; esas filas permanecen cero en W

Explicador visual de Marktechpost

01 — Antecedentes

¿Qué es la destilación del conocimiento?

La destilación de conocimiento (KD) transfiere el “conocimiento oscuro” de un modelo de maestro grande a un modelo de estudiante más pequeño. El estudiante aprende de la distribución de probabilidad completa del siguiente token del maestro, no solo de la respuesta correcta.

Esto se hace mediante la divergencia KL por posición sobre la distribución de salida del profesor en cada posición del token en la secuencia.

La restricción: el KD estándar requiere un tokenizador compartido. Si Llama-3.2-1B es el estudiante, no puede aprender de Qwen3-4B o Phi-4-mini: sus vocabularios simbólicos no se alinean. Las posiciones de los tokens no tienen correspondencia entre las diferentes familias de tokenizadores.

Tokenizador Llama Student

Maestros incompatibles Qwen / Phi

≠ Coincidencia de vocabulario no coincidente

02 — El problema

Dos fallas estructurales en el ORO

GOLD es el método KD de tokenizador cruzado de última generación. Divide los tokens en un subconjunto común con coincidencia de cadenas (entrenado con KL) y un resto poco común (entrenado con coincidencia de rangos ULD).

Los investigadores de NVIDIA identificaron dos fallos distintos:

1

Fallo de token poco común: los tokens críticos se incluyen en el subconjunto no coincidente. Llama incluye "201" como una ficha. Qwen lo divide en "2", "0", "1". Los 1.100 números Llama de varios dígitos se incluyen en el conjunto poco común de Qwen3-4B. Reciben ruido independiente de la identidad y gradientes de supresión: GSM8k cae a 2,56.

2

Coincidencia demasiado conservadora: la igualdad estricta de cadenas descarta pares bien formados. Token de estudiante Cientos se asigna a tokens de maestro Hund + rojos , pero GOLD elimina esta alineación por completo.

03 — Solución

X-Token: tres componentes principales

X-Token es un método KD de tokenizador cruzado basado en distribución logit. No requiere componentes auxiliares entrenables ni cambios arquitectónicos; es un reemplazo directo para la pérdida de KD estándar.

1

Alineación de tramo: la alineación basada en DP agrupa tokens en fragmentos que se decodifican en la misma subcadena de texto. Almacenado en caché por secuencia: cero gastos generales por paso.

2

Matriz de proyección W: una matriz dispersa W ∈ ℝ⁼|V_S|×|V_T|⁽ asigna cada ficha de estudiante a una combinación ponderada de fichas de maestro, cerrando la brecha de vocabulario.

3

Dos modos de pérdida: P-KL elimina la partición por completo. H-KL conserva la partición pero relaja la coincidencia mediante asignaciones top-1 en W. Cada uno apunta a un modo de falla diferente.

04 — Matriz de proyección W

Cómo se construye W

W se construye de forma determinista antes del entrenamiento en dos pasadas. No se requieren datos de entrenamiento ni parámetros aprendidos en la inicialización.

1

Pase de coincidencia exacta: para cada par de tokens (estudiante, maestro) cuyas cadenas decodificadas coincidan después de la canonicalización, establezca W[s,t] = 1. La canonicalización unifica prefijos de espacio, nuevas líneas, tokens de reserva de bytes y tokens especiales entre familias.

2

Pase de regla de múltiples tokens: para tokens de estudiantes que no coinciden, vuelva a tokenizar su texto decodificado bajo el maestro. Asigne pesos decaídos W[s,τᵢ] = β·γⁱ con (β,γ) = (0,9, 0,1). Un lapso de 2 tokens obtiene (0,909, 0,091). Cada fila se trunca a las 4 entradas principales y se normaliza por fila.

Debido a que cada fila suma 1, Wᵀ preserva la probabilidad: Wᵀp_S es un vector de probabilidad válido sobre V_T sin normalización adicional.

05 — Formulaciones de pérdidas

P-KL vs H-KL: cuándo usar cada uno

La selección se basa en una auditoría de cobertura: medir qué fracción de categorías de tokens críticos (por ejemplo, números de varios dígitos) aparecen en el conjunto común C.

Propiedad P-KL H-KL Partición Eliminada por completo Retenida, relajada Coincidencia Vocabulario completo a través de W Top-1 bajo W Usar cuando los tokens críticos quedan fuera de C La partición es sólida Ejemplo del maestro Qwen3-4B Phi-4-mini-Instruct Promedio. ganancia frente a ORO +3,82 +0,52

La aplicación del modo incorrecto invierte los resultados: P-KL en Phi-mini cae a 37,50 en promedio. frente al 39,18 del H-KL.

06 — Resultados

Resultados de referencia en Llama-3.2-1B (3 disparos)

Estudiante: Llama-3.2-1B: entrenado en NemotronClimbMix, 30.000 pasos, lote 768, contexto 4096.

Método GSM8k promedio. Llama-1B (base) 5,69 33,96 Entrenamiento previo continuo 10,25 36,63 Mismo tokenizador KD (Llama-3B) 12,89 38,40 Qwen-4B, GOLD 2,56 35,03 Qwen-4B, X-Token (P-KL) 15,54 38,85 Phi-mini, GOLD 16,50 38,66 Phi-mini, X-Token (H-KL) 19,11 39,18 Phi-mini + Llama-3B (Multi) 20,39 40,48

07 — Destilación de varios profesores

La complementariedad docente genera ganancias

X-Token se extiende a varios profesores. Cada uno tiene su propia matriz de proyección W_m y modo de pérdida. La pérdida agregada utiliza ponderaciones por maestro α_m.

Hallazgo clave: la ponderación estática supera a la ponderación adaptativa de confianza en todas las configuraciones probadas. Phi-mini (α=0,8) + Llama-3B (α=0,2) logra el mejor resultado.

Promedio de combinación de maestros Nota Solo Phi-mini (H-KL) 39.18 Mejor Phi-mini + Llama-3B individual 40.48 Phi-mini + Qwen-4B complementario 38.49 Phi-mini + Qwen-4B + Llama-3B superpuestos 40.15 El tercer maestro duele en matemáticas

La combinación de dos profesores con mucho razonamiento (Phi-mini + Qwen-4B) obtiene puntuaciones inferiores al mejor profesor individual. La diversidad de docentes importa más que el número de docentes.

08 – Conclusiones clave

Qué recordar sobre X-Token

1

La partición de GOLD perjudica activamente el entrenamiento cuando los tokens críticos (por ejemplo, números de varios dígitos) caen en el conjunto poco común: P-KL elimina la partición por completo utilizando la matriz de proyección W.

2

H-KL conserva la partición pero relaja la coincidencia con las asignaciones principales 1 en W, mejor cuando la partición es estructuralmente sólida.

3

La matriz de proyección W se construye basada en reglas antes del entrenamiento a partir de cadenas de tokenizadores únicamente; no se requieren parámetros aprendidos en el inicio.

4

Los beneficios de varios docentes (+1,3 respecto de los de un solo docente) provienen de la complementariedad docente, no de la incorporación de más docentes con fortalezas superpuestas.

5

GSM8k se recupera de 2,56 (GOLD) a 15,54 (P-KL), una ganancia de 6 veces que supera el KD del mismo tokenizador de un maestro Llama-3.2-3B más fuerte.

arXiv: 2605.21699 — Institución: NVIDIA

Conclusiones clave

X-Token identifica dos modos de falla distintos y opuestos en GOLD: supresión de tokens poco comunes (solución: eliminar la partición con P-KL) y coincidencia excesivamente conservadora (solución: relajarla con H-KL). La matriz de proyección W se construye basada en reglas a partir de cadenas de tokenizadores antes del entrenamiento; Opcionalmente, se puede perfeccionar conjuntamente con el estudiante para obtener ganancias adicionales. P-KL en Qwen3-4B mejora con respecto a GOLD en un promedio de +3,82. y recupera GSM8k de 2,56 a 15,54. Los beneficios de la destilación de varios docentes (+1,3 respecto de un solo docente) provienen de la complementariedad docente, no sólo de la incorporación de más docentes. La selección del modo de pérdida (P-KL frente a H-KL) se determina mediante una auditoría de cobertura de las categorías de tokens; aplicar el modo incorrecto invierte la clasificación.

Consulte el artículo de investigación. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros