Dos modelos fronterizos de peso abierto se enviaron con un día de diferencia entre sí esta semana. Z.ai lanzó GLM-5.3-Flash, un modelo MoE multimodal de 320B de parámetros con 18B de parámetros activos. El equipo Qwen de Alibaba lanzó Qwen3.8-Flash-Next, un modelo de 125B con 6B de parámetros activos que presenta una vista previa de la arquitectura Qwen4.
Los dos equipos diseñaron estos sistemas de forma independiente. Sin embargo, sus configuraciones se leen como casi copias unas de otras. Ambos utilizan un híbrido 3:1 de atención lineal y total. Ambos seleccionan contexto con un indexador comprimido con un límite de 2048 tokens. Ambos amplían el arroyo residual en 4 ramales cerrados. Ambos entrenan con el optimizador Muon, con matrices de parámetros fusionadas divididas antes de la ortogonalización. Este artículo analiza la receta compartida, el único punto de desacuerdo y el único laboratorio que discrepa.
Los dos lanzamientos en resumen
GLM-5.3-Flash es el primer modelo multimodal nativo de la serie GLM-5, lanzado bajo la licencia del MIT en Hugging Face. Z.ai lo probó de forma anónima como Ox Alpha en OpenRouter, donde se convirtió en el modelo más popular de la semana. Fue entrenado en un corpus multimodal de 30T tokens y sirve una ventana contextual de 1M de tokens. Z.ai dice que supera a GLM-5.2 en todos los puntos de referencia a una décima parte del precio, mientras se acerca a Claude Opus 4.8 en puntos de referencia de codificación y agentes. El precio de lista es de 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida.
Qwen3.8-Flash-Next desempeña el papel que desempeñó Qwen3-Next para Qwen3.5: una vista previa pública de la próxima familia de arquitectura. La tarjeta modelo enumera un modelo principal de 125 B más una tabla de incrustación de n-gramas adicional de 51 B, con 6 B de parámetros activados por token. El contexto nativo es de 262,144 tokens, extensible a 1 millón con YaRN. El equipo de Qwen informa que la capacitación requirió solo aproximadamente una novena parte del cómputo de Qwen3.7-Plus. El informe técnico adjunto se titula “Sobre el diseño de la arquitectura Qwen3.8-Next: evaluación, eficiencia y estabilidad del entrenamiento”.