NVIDIA presenta una metodología de preentrenamiento de 4 bits utilizando NVFP4, validada en un transformador Mamba híbrido de 12B en 10T Token Horizon

La formación previa de LLM a escala de frontera en el FP8 es ahora una práctica estándar, pero pasar al punto flotante de 4 bits sigue siendo un problema de investigación abierto porque los formatos más estrechos comprimen el rango dinámico y amplifican el error de cuantificación en horizontes de tokens largos. Una nueva investigación de NVIDIA describe una metodología de preentrenamiento basada en NVFP4, un formato de microescalado de 4 bits compatible de forma nativa con Blackwell Tensor Cores, y la valida entrenando previamente un Mamba-Transformer híbrido de 12 mil millones de parámetros en 10 billones de tokens. El equipo de investigación afirma que este es el entrenamiento más largo documentado públicamente con precisión de 4 bits hasta la fecha. El modelo resultante alcanza el 62,58% en MMLU-Pro 5-shot frente al 62,62% de la línea base FP8, y es compatible con Transformer Engine de NVIDIA.

Qué es realmente NVFP4

Para comprender por qué NVFP4 es importante, es útil revisar cómo funcionan los formatos de microescala. En un formato de microescala (MX), un bloque contiguo de elementos de baja precisión comparte un factor de escala único, que se utiliza para mapear el bloque nuevamente en un rango numérico más amplio durante la multiplicación de la matriz. MXFP4 utiliza bloques de 32 elementos donde cada elemento se almacena como E2M1 (1 bit de signo, 2 bits de exponente, 1 bit de mantisa) que codifica solo los valores ±0, ±0,5, ±1, ±1,5, ±2, ±3, ±4 y ±6. Los factores de escala de bloque se almacenan en UE8M0, lo que los restringe a potencias de dos.

NVFP4 cambia tres cosas. Primero, el tamaño del bloque cae de 32 a 16 elementos, reduciendo el rango dinámico que cada escala debe cubrir. En segundo lugar, los factores de escala de bloque se almacenan en E4M3 en lugar de UE8M0, intercambiando el rango de exponente por la precisión de mantisa, de modo que el amax (máximo absoluto) por bloque se pueda mapear mucho más cerca del máximo representable del FP4. En tercer lugar, NVFP4 agrega un segundo nivel de escala: una escala por tensor FP32 que reasigna los valores para que las escalas del bloque E4M3 permanezcan dentro del rango. El resultado es que al menos el 6,25% de los valores en cada bloque (el amax por bloque) están representados con una precisión cercana al FP8, mientras que el resto se ubica en el FP4.

En NVIDIA Blackwell, los GEMM del FP4 funcionan con un rendimiento de BF16 de 4× en GB200 y de 6× en GB300, lo que se traduce en aceleraciones de aproximadamente 2× y 3× con respecto a FP8. El uso de memoria de operandos se reduce aproximadamente a la mitad en comparación con el FP8.

https://arxiv.org/pdf/2509.25149

Qué está cuantificado y qué no

Solo los GEMM dentro de las capas lineales (totalmente conectadas) Fprop, Dgrad y Wgrad realmente se ejecutan en NVFP4. Las incrustaciones, el cabezal de proyección de salida, las capas de normalización, las no linealidades y todos los componentes de atención (softmax y los GEMM por lotes de clave de consulta y valor de puntuación de atención) permanecen en BF16 o FP32. Los pesos del modelo, los gradientes de peso utilizados para la acumulación entre microlotes y réplicas de datos paralelos, y los estados del optimizador se mantienen en FP32. Las reducciones paralelas del tensor se ejecutan en BF16.

La metodología de formación de cuatro partes

La cuantización de cada GEMM de capa lineal a NVFP4 con la configuración predeterminada (escalado de bloque de 1 × 16 en todas partes, redondeo al más cercano, incluso en cada tensor, sin transformaciones) diverge al principio del entrenamiento. El enfoque de NVIDIA lo estabiliza con cuatro componentes y los estudios de ablación en el modelo 12B muestran que cada uno de ellos es necesario.

Alta precisión selectiva: las capas lineales en los dos primeros y los últimos ocho de los 62 bloques (aproximadamente el 16% de todas las capas lineales) se mantienen en BF16. Ablaciones indicó que los bloques finales son los sensibles porque requieren más rango dinámico que el que proporciona el 4PM; mantener sólo los últimos cuatro bloques en BF16 también fue suficiente para una convergencia estable.

Transformadas aleatorias de Hadamard (RHT): los valores atípicos en los gradientes de peso se distribuyen en una distribución aproximadamente gaussiana multiplicando los mosaicos de entrada con una matriz de Hadamard de 16 × 16 combinada con un vector de signo aleatorio de ±1. Debido a que las transformaciones ortogonales se cancelan dentro del producto escalar, no se necesita corrección matemática en el GEMM. El tamaño d=16 se eligió empíricamente: d=4 perjudica la convergencia, d=128 dio resultados similares. RHT se aplica solo a las entradas del GEMM de gradiente de peso (Wgrad), y se comparte un único vector de signo aleatorio en todas las capas lineales. La aleatorización en sí misma no fue operativa en la escala de 1.200 millones, pero mejoró considerablemente en la escala de 12.000 millones.

Escalado de bloques bidimensionales (2D) para pesos: el NVFP4 estándar escala bloques de 1×16 a lo largo de la dimensión del producto escalar. Debido a que el paso hacia atrás transpone el tensor de peso, los pases hacia adelante y hacia atrás terminan con pesos cuantificados diferentes, rompiendo la regla de la cadena. La solución de NVIDIA es escalar los pesos en bloques de 16×16 para que se utilice la misma representación cuantificada en ambas pasadas. Las activaciones y gradientes mantienen una escala de 1×16, ya que son menos sensibles a esta inconsistencia.

Redondeo estocástico en gradientes: el redondeo al par más cercano introduce un sesgo sistemático cuando se aplica a tensores de gradiente. El redondeo estocástico redondea probabilísticamente en función de la distancia a los dos valores representables más cercanos, eliminando ese sesgo. El equipo de investigación señala explícitamente en un artículo de investigación que el redondeo estocástico es perjudicial cuando se aplica a tensores de paso hacia adelante, por lo que se limita a gradientes.

Resultados del transformador Mamba híbrido 12B

El modelo 12B utiliza la arquitectura Nemotron-Nano-12B-v2-Base: 62 bloques (6 Self-Attention, 28 FFN, 28 Mamba-2), dimensión oculta 5120, dimensión FFN 20480, entrenados con un programa de calentamiento-estable-decaimiento (LR constante durante el 80% del entrenamiento, decaimiento en el 20% final), tamaño de lote 736, longitud de secuencia 8192. La línea base de referencia del FP8 sigue la metodología DeepSeek-V3: elementos E4M3, bloques de peso de 128 × 128, bloques de activación y gradiente de 1 × 128, con el primer bloque y los dos últimos bloques mantenidos en BF16.

La pérdida de validación de NVFP4 se mantiene dentro del 1% de la línea de base del FP8 durante la fase estable y se amplía a ligeramente por encima del 1,5% durante el decaimiento. La precisión descendente es comparable en la mayoría de los puntos de referencia: MMLU 76,57 % frente a 77,36 %, GSM8K CoT 92,27 % frente a 89,08 %, MATH 81,48 % frente a 83,32 %, AGIEval English CoT 70,31 % frente a 67,01 %. La codificación muestra la brecha más grande (HumanEval+ 57,43% frente a 59,93%, MBPP+ 55,91% frente a 59,11%) que el equipo de investigación atribuye en parte a la ruidosa evaluación del punto de control final. El equipo de investigación también documenta una técnica de cambio de precisión: la transición del pase directo de NVFP4 a BF16 a partir de 8,2 T de tokens (aproximadamente el 18 % del cronograma) redujo el error de pérdida relativa del 1,5 % al 0,5 %.

NVFP4 frente a MXFP4

En un Mamba-Transformer híbrido 8B separado entrenado en tokens 1T, NVFP4 alcanzó un error de pérdida relativa de aproximadamente el 1,5% frente a BF16, mientras que MXFP4 se mantuvo cerca del 2,5%. Para cerrar la brecha, MXFP4 requirió 1,36T de tokens para igualar la pérdida de 1T de NVFP4: una sobrecarga de token del 36%. El equipo de investigación atribuye la diferencia al tamaño de bloque más pequeño de NVFP4 y a las escalas E4M3, que conservan más rango dinámico de FP4 que las escalas UE8M0 de potencia de dos de MXFP4 (que pueden desperdiciar hasta una binada y las ±4, ±6 muestras en el peor de los casos).

Explicador visual de Marktechpost

● Informe técnico de NVIDIA

Una receta de entrenamiento de punto flotante de 4 bits validada en un Mamba-Transformer híbrido de 12 mil millones de parámetros entrenado en 10 billones de tokens: la ejecución de preentrenamiento de 4 bits más larga documentada públicamente hasta la fecha.

62,58%

MMLU-Pro (frente a 62.62 FP8)

FUENTE: arXiv:2509.25149v2 · NVIDIA · Disponible en Transformer Engine

01 — Contexto

¿Por qué pasar del FP8 al preentrenamiento de 4 bits?

La formación del 8PM es ahora un estándar para la formación previa en LLM de vanguardia. Pasar al FP4 promete un aumento de 2 a 3 veces en el rendimiento aritmético con respecto al FP8 y aproximadamente la mitad de la memoria de operandos, pero los formatos más estrechos comprimen el rango dinámico y amplifican el error de cuantificación en horizontes de tokens largos.

El desafío es preservar la estabilidad del entrenamiento y la precisión posterior en carreras de varios billones de tokens. Este informe presenta una receta que hace ambas cosas, utilizando NVFP4, un formato de microescalado de 4 bits con soporte nativo en NVIDIA Blackwell Tensor Cores.

Rendimiento GB200

Línea de base BF16 1× FP8 2× FP4 (NVFP4) 4×

Rendimiento GB300

Línea base BF16 1× FP8 2× FP4 (NVFP4) 6×

02 — El formato

Lo que realmente almacena NVFP4

Cada elemento está codificado como E2M1 (1 signo, 2 exponente, 1 bit de mantisa) que representa uno de: ±0, ±0,5, ±1, ±1,5, ±2, ±3, ±4, ±6.

Cada bloque de 16 elementos contiguos comparte un único factor de escala E4M3. Una segunda báscula por tensor FP32 se encuentra en la parte superior para mantener las básculas de bloque E4M3 dentro del alcance. El resultado: al menos el 6,25% de los valores en cada bloque (el amax por bloque) tienen una precisión cercana al FP8.

Escala del 8PM

6

0,5

-2

-4

1

0

3

-1

2

4

-3

0,5

-1

2

0

4

Escala de bloque E4M3 Bloque amax (asignado a FP4 max) 16 elementos FP4

03 — Comparación de formatos

En qué se diferencia NVFP4 de MXFP4

NVFP4 realiza tres cambios de diseño en el enfoque de microescala que mejoran significativamente la fidelidad de la representación a 4 bits.

MXFP4

Tamaño de bloque 32 Elemento E2M1 Escala de bloque UE8M0 Tipo de escala Potencia de 2 Escala de tensor Ninguno

NVFP4

Tamaño de bloque 16 Elemento E2M1 Escala de bloque E4M3 Tipo de escala Escala de tensor fraccional FP32

Las escalas UE8M0 de potencia de dos de MXFP4 pueden desperdiciar hasta una binada de rango dinámico y perder las muestras de ±4 y ±6 FP4 después del redondeo de escala. Las escalas E4M3 de NVFP4 mapean el bloque amax mucho más cerca del máximo de FP4.

04 — Alcance

Qué se ejecuta en NVFP4 y qué no

Sólo los tres GEMM dentro de las capas lineales (Fprop, Dgrad y Wgrad) realmente se ejecutan en NVFP4. Todo lo demás se mantiene con mayor precisión.

En NVFP4

Lineal Fprop GEMM Lineal Dgrad GEMM Lineal Wgrad GEMM

En BF16 / FP32

Incrustaciones · Cabezal de salida Capas de normalización No linealidades Atención (softmax, QK, score-V) Pesos maestros · Estados del optimizador Reducciones de TP (BF16)

La etiqueta "entrenamiento FP4" se aplica a los GEMM con mayor capacidad informática, no al gráfico completo de avance y retroceso.

05 — La Receta

Cuatro técnicas necesarias para la convergencia

La cuantización de cada GEMM de capa lineal a NVFP4 con la configuración predeterminada (escalado de bloque de 1 × 16 en todas partes, de redondeo a par más cercano, sin transformaciones) diverge al principio del entrenamiento. La receta lo estabiliza con cuatro componentes. Las ablaciones muestran que ambas son necesarias.

1

Alta precisión selectiva

Mantenga ~16% de las capas lineales en BF16, concentrado en los bloques finales. Para el modelo 12B: primeros 2 + últimos 8 de 62 bloques.

2

Transformadas aleatorias de Hadamard (RHT)

Matriz de Hadamard de 16 × 16 + vector de signo aleatorio ±1, aplicado solo a entradas Wgrad. d=4 fue peor; d=128 fue similar a d=16.

3

Escalado de bloques 2D para pesas

Escalas de bloques de 16 × 16 para pesos, de modo que hacia adelante y hacia atrás se ve la misma representación cuantificada. Las activaciones y gradientes mantienen una escala de 1×16.

4

Redondeo estocástico en gradientes

El redondeo probabilístico elimina el sesgo de gradiente sistemático. Perjudicial para los tensores de paso hacia adelante: restringir solo a gradientes.

06 — Configuración del entrenamiento

El híbrido Mamba-Transformer 12B

El modelo utiliza la arquitectura Nemotron-Nano-12B-v2-Base: 62 bloques que constan de 6 bloques Self-Attention, 28 FFN y 28 Mamba-2.

Arquitectura

Bloques 62 Atenuación oculta 5120 Atenuación FFN 20480 Cabezales Q Cabezales de 40 KV 8 Atenuación en estado Mamba 128

Capacitación

Fichas 10T Tamaño de lote 736 Longitud de secuencia 8192 Programa WSD 80/20 Pico LR 4,5e-4 Decaimiento de peso 0,1

La línea de base de referencia del FP8 sigue DeepSeek-V3: elementos E4M3, bloques de peso de 128 × 128, bloques de activación/gradiente de 1 × 128, con el primer bloque y los dos últimos en BF16.

07 — Resultados posteriores

NVFP4 coincide con FP8 en la mayoría de los puntos de referencia

La pérdida de validación se mantiene dentro del 1% del 8PM durante la fase estable, ampliándose a ligeramente por encima del 1,5% durante la decadencia. Las precisiones posteriores se rastrean a continuación.

BenchmarkFP8NVFP4 MMLU-Pro 5-shot62.6262.58 MMLU77.3676.57 AGIEval Inglés CoT67.0170.31 GSM8K CoT89.0892.27 MATH83.3281.48 MGSM81.8785.53 HumanEval+59.9357.43 MBPP+59.1155.91 Desafío ARC91.8191.81

La codificación muestra la brecha más amplia. Cambiar el pase directo a BF16 con 8,2T de tokens (último 18%) reduce el error de pérdida relativa del 1,5% al ​​0,5%.

08 – Eficiencia del formato

NVFP4 vs MXFP4 en el mismo modelo 8B

En un Mamba-Transformer híbrido 8B entrenado con los mismos datos, NVFP4 convergió a una pérdida significativamente mejor que MXFP4 con el mismo presupuesto de token.

Pérdida frente a tokens BF16 @ 1T

NVFP4 ~1.5% de brecha MXFP4 ~2.5% de brecha

Fichas para igualar la pérdida de NVFP4

NVFP4 1,00T MXFP4 1,36T (+36%)

La sobrecarga del token del 36 % se traduce directamente en un tiempo de formación más prolongado. El tamaño de bloque más pequeño y las escalas E4M3 conservan más rango dinámico del FP4 que el diseño UE8M0 del MXFP4.

09 — Conclusiones del practicante

Lo que esto desbloquea para los ingenieros de IA

El preentrenamiento de 4 bits a una escala de varios billones de tokens ahora es reproducible con una receta conocida, en hardware Blackwell, a través de Transformer Engine.

✓

Rendimiento y memoria

Los GEMM del FP4 funcionan 2 veces más rápido que el FP8 en GB200 y 3 veces en GB300. La memoria de operandos se redujo aproximadamente a la mitad.

✓

Receta reproducible

Capas selectivas BF16 + 16×16 RHT en Wgrad + escalado de peso 2D + redondeo estocástico en gradientes.

→

Preguntas abiertas

Cuantificar todas las capas lineales, extender NVFP4 a las rutas de atención y comunicación, escalar leyes para FP4 a través de recuentos de parámetros y horizontes.

⌘

Disponibilidad

El entrenamiento NVFP4 es compatible con NVIDIA Transformer Engine. Fuente: arXiv:2509.25149v2.

MARKTECHPOST · Investigación en IA, explicada en profundidad.

Conclusiones clave

El equipo de investigación de NVIDIA preentrenó un Mamba-Transformer híbrido de 12B en tokens de 10T en NVFP4 (la ejecución de entrenamiento de 4 bits más larga documentada públicamente), igualando a FP8 en MMLU-Pro con un 62,58 % frente a un 62,62 %. NVFP4 utiliza bloques de 16 elementos con escalas E4M3 más una escala por tensor FP32, preservando las muestras ±4 y ±6 que el diseño UE8M0 de 32 elementos de MXFP4 puede perder debido al redondeo de potencia de dos. Se requieren cuatro técnicas para la convergencia; ninguna es opcional: ~16 % de capas lineales en BF16, transformaciones aleatorias de Hadamard de 16 × 16 en entradas Wgrad, escalado de peso 2D de 16 × 16 y redondeo estocástico solo en gradientes. Solo los GEMM de capa lineal se ejecutan en NVFP4: la atención, las incrustaciones, la normalización, las no linealidades, los pesos maestros, los gradientes y los estados del optimizador permanecen en BF16 o FP32. En un modelo 8B, MXFP4 necesitaba 1,36T de tokens (36% más) para igualar la pérdida de NVFP4 con 1T de tokens, mientras que los GEMM de FP4 ofrecen un rendimiento 2× de FP8 en GB200 y 3× en GB300.

Consulte el documento aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros