YuanLab AI lanza Yuan 3.0 Ultra: un modelo emblemático de base MoE multimodal, creado para una inteligencia más sólida y una eficiencia inigualable

¿Cómo puede un modelo de lenguaje grande de un billón de parámetros lograr un rendimiento empresarial de vanguardia y al mismo tiempo reducir su recuento total de parámetros en un 33,3 % y aumentar la eficiencia de la capacitación previa en un 49 %? Yuan Lab AI lanza Yuan3.0 Ultra, un modelo de lenguaje grande de mezcla de expertos (MoE) de código abierto que presenta 1T de parámetros totales y 68,800 millones de parámetros activados. La arquitectura del modelo está diseñada para optimizar el rendimiento en tareas específicas de la empresa manteniendo al mismo tiempo capacidades competitivas de propósito general. A diferencia de los modelos densos tradicionales, Yuan3.0 Ultra utiliza la escasez para escalar la capacidad sin un aumento lineal en el costo computacional.

Poda experta adaptativa a capas (LAEP)

La principal innovación en la capacitación de Yuan3.0 Ultra es el algoritmo de poda experta adaptativa de capas (LAEP). Si bien la poda de expertos generalmente se aplica después de la capacitación, LAEP identifica y elimina a los expertos infrautilizados directamente durante la etapa previa a la capacitación.

La investigación sobre la distribución de carga experta reveló dos fases distintas durante el preentrenamiento:

Fase de transición inicial: caracterizada por una alta volatilidad en las cargas expertas heredadas de la inicialización aleatoria. Fase estable: las cargas de expertos convergen y la clasificación relativa de los expertos según la asignación de tokens permanece en gran medida fija.

Una vez alcanzada la fase estable, LAEP aplica la poda basándose en dos restricciones:

Restricción de carga individual (⍺): se dirige a expertos cuya carga de tokens es significativamente menor que el promedio de la capa. Restricción de carga acumulativa (β): identifica el subconjunto de expertos que contribuyen menos al procesamiento total de tokens.

Al aplicar LAEP con β = 0,1 y variar ⍺, el modelo se redujo desde parámetros iniciales de 1,5 T hasta parámetros de 1 T. Esta reducción del 33,3 % en los parámetros totales preservó el rendimiento multidominio del modelo y, al mismo tiempo, redujo significativamente los requisitos de memoria para la implementación. En la configuración 1T, el número de expertos por capa se redujo de 64 a un máximo de 48 expertos conservados.

https://github.com/Yuan-lab-LLM/Yuan3.0-Ultra/blob/main/Docs/Yuan3.0_Ultra%20Paper.pdf

Eficiencia del hardware y reorganización experta

Los modelos MoE a menudo sufren un desequilibrio de carga a nivel de dispositivo cuando los expertos están distribuidos en un clúster informático. Para solucionar este problema, Yuan3.0 Ultra implementa un algoritmo de reorganización experta.

Este algoritmo clasifica a los expertos por carga de tokens y utiliza una estrategia codiciosa para distribuirlos entre las GPU para minimizar la variación acumulada de tokens.

MétodoTFLOPS por GPUModelo base (1515B)62,14Pérdida auxiliar DeepSeek-V380,82Yuan3.0 Ultra (LAEP)92,60

La eficiencia total previa a la capacitación mejoró en un 49 %. Esta mejora se atribuye a dos factores:

Poda de modelo: Contribuyó con un 32,4% a la ganancia de eficiencia. Reordenamiento de expertos: contribuyó con un 15,9% a la ganancia de eficiencia.

Mitigar el pensamiento excesivo con el RIRM revisado

En la etapa de aprendizaje por refuerzo (RL), el modelo emplea un mecanismo de recompensa, inhibición de la reflexión (RIRM) refinado para evitar cadenas de razonamiento excesivamente largas para tareas simples.

La recompensa por la reflexión, $R_{ver}$, se calcula utilizando un sistema de penalización basado en umbrales:

rmin=0: el número ideal de pasos de reflexión para respuestas directas. rmax=3: El umbral de reflexión máximo tolerable.

Para las muestras correctas, la recompensa disminuye a medida que los pasos de reflexión se acercan a rmax, mientras que las muestras incorrectas que “piensan demasiado” (superando rmax) reciben penalizaciones máximas. Este mecanismo resultó en una ganancia del 16,33 % en la precisión del entrenamiento y una reducción del 14,38 % en la longitud del token de salida.

https://github.com/Yuan-lab-LLM/Yuan3.0-Ultra/blob/main/Docs/Yuan3.0_Ultra%20Paper.pdf

Rendimiento de referencia empresarial

Yuan3.0 Ultra se evaluó con varios modelos de la industria, incluidos GPT-5.2 y Gemini 3.1 Pro, en puntos de referencia empresariales especializados.

BenchmarkCategoría de tareaPuntuación Ultra Yuan3.0Puntuación del competidor líderDocmatixMultimodal RAG67,4%48,4% (GPT-5.2)ChatRAGRecuperación de texto (Promedio)68,2%53,6% (Kimi K2.5)MMTabTable Reasoning62,3%66,2% (Kimi K2.5)SummEvalText Resumen62,8%49,9% (Claude Opus 4.6)Spider 1.0Text-to-SQL83,9%82,7% (Kimi K2.5)Invocación de herramienta BFCL V367,8%78,8% (Gemini 3.1 Pro)

Los resultados indican que Yuan3.0 Ultra logra una precisión de vanguardia en la recuperación multimodal (Docmatix) y la recuperación de contexto prolongado (ChatRAG), al tiempo que mantiene un rendimiento sólido en el procesamiento de datos estructurados y la llamada de herramientas.

Consulte el documento y el repositorio. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.