MiniMax lanzó oficialmente MiniMax M3 el 1 de junio de 2026. El modelo presenta MSA (MiniMax Sparse Attention), una nueva arquitectura de atención dispersa que le da a M3 una ventana de contexto de 1 millón de tokens. M3 también admite de forma nativa la entrada de imágenes y vídeos y el funcionamiento de una computadora de escritorio. La API ya está activa.
MiniMax M3 está disponible hoy a través del Código MiniMax, el Plan de token MiniMax y la API MiniMax. Es el siguiente modelo de la línea de la serie M después del M2.7. MiniMax posiciona a M3 como un modelo de peso abierto que combina rendimiento de codificación de nivel fronterizo, una ventana de contexto de 1 millón de tokens y entrada multimodal nativa en una sola arquitectura: el primero en hacerlo, según MiniMax. Los pesos del modelo correspondientes y el informe técnico están programados para publicarse dentro de los 10 días posteriores al lanzamiento.
MSA: Atención escasa MiniMax
El cambio arquitectónico central en MiniMax M3 es MSA (MiniMax Sparse Attention). La atención total estándar tiene una complejidad computacional cuadrática: a medida que crece la longitud del contexto, el costo de cómputo crece como el cuadrado de la longitud de la secuencia. MSA está diseñado para abordar esto.
Los mecanismos de atención dispersa generalmente agregan una etapa de filtrado previo antes de calcular la atención, evitando el costo cuadrático total. El equipo de MiniMax afirma que, en comparación con enfoques como DSA y MoBA, MSA divide la caché KV en bloques con mayor precisión, logrando una mayor cobertura de contexto efectiva.
A nivel de operador, MSA utiliza un enfoque de “recogida exterior KV Q”. Los bloques KV sirven como bucle externo para agregar las consultas que los afectan. Cada bloque se lee solo una vez y el acceso a la memoria es contiguo. El equipo de MiniMax informa que esto es más de 4 veces más rápido que las implementaciones de código abierto como Flash-Sparse-Attention y flash-moba bajo la configuración principal de MiniMax M3.
El resultado: en una longitud de contexto de 1 millón de tokens, el cálculo por token de MiniMax M3 es 1/20 del de los modelos M2 de la generación anterior. El equipo de MiniMax informa una aceleración de más de 9 veces en la etapa de precarga y de más de 15 veces en la etapa de decodificación en un contexto de 1 millón de tokens. En múltiples estudios de ablación, MSA prestó total atención a la mayoría de las capacidades.
Codificación y puntos de referencia agentes
Las capacidades de codificación y agencia son áreas clave de mejora para M3. Los resultados de las pruebas comparativas a continuación son informados por el equipo de MiniMax. Se realizaron varias evaluaciones en la infraestructura interna de MiniMax, mientras que algunas puntuaciones comparativas se tomaron de tablas de clasificación oficiales o fuentes de referencia externas, como se indica en la metodología de MiniMax. SWE-Bench Verified se probó en infraestructura interna utilizando andamios de Claude Code y se promedió en 4 ejecuciones. SWE-Bench Pro también se probó en infraestructura interna utilizando andamios de Claude Code, con una lógica de prueba alineada con la evaluación oficial.
SWE-Bench Pro: 59,0 % (supera GPT-5.5 y Gemini 3.1 Pro; se acerca a Opus 4.7) Terminal-Bench 2.1: 66,0 % SWE-fficiency: 34,8 % KernelBench Hard: 28,8 % (evaluado en GPU NVIDIA Blackwell, capacidad CUDA sm_120) MCP Atlas: 74,2 % Claw-Eval: puntuación más alta entre los modelos evaluados (Grupo de tareas general, 161 tareas) SVG-Bench: supera a Opus 4.7
En OmniDocBench, un punto de referencia de comprensión de documentos multimodal, M3 obtiene una puntuación superior a Gemini 3.1 Pro. En OSWorld-Verified (361 muestras), M3 logra una tasa de finalización de tareas del 70,06 % para el uso de la computadora (pasos máximos = 200).
MiniMax también creó un marco de simulación de usuario interactivo para capacitación y evaluación. Simula la colaboración de desarrolladores en múltiples turnos: elaboración de requisitos, discusión de soluciones, corrección basada en comentarios, cambio continuo de tareas e iteración de proyectos en múltiples rondas. Esto tiene como objetivo reducir la brecha entre el rendimiento de referencia de un solo turno y los flujos de trabajo de desarrolladores de múltiples turnos del mundo real.
Multimodalidad Nativa
MiniMax M3 se sometió a un entrenamiento de modalidad mixta desde el paso 0. El texto, las imágenes y el video se entrenan juntos desde el principio en lugar de agregarse después del entrenamiento. El equipo de MiniMax informa que los datos entrelazados (secuencias en las que el texto y las imágenes se mezclan de forma natural) son más críticos para el rendimiento del modelo de lo que comúnmente se supone. Después de reconstruir todo el proceso de datos para formatos intercalados, los datos de entrenamiento se ampliaron al orden de 100 billones de tokens.
MiniMax M3 admite entrada de imágenes y videos y puede operar una computadora de escritorio.
Ejemplos de tareas del mundo real de MiniMax
MiniMax documenta tres tareas internas en la publicación de lanzamiento:
Reproducción en papel: MiniMax otorgó a MiniMax M3 el artículo ganador del premio ICLR 2025 Outstanding Paper Award Learning Dynamics of LLM Finetuning y le pidió que reprodujera los experimentos de forma independiente. M3 funcionó de forma autónoma durante casi 12 horas, produjo 18 confirmaciones y 23 figuras experimentales y completó los experimentos principales sin intervención humana. Requería capacidad multimodal para leer curvas y fórmulas, un contexto largo para contener el papel y los registros de experimentos simultáneamente, y capacidad de codificación para ejecutar la reproducción a través de un hilo largo.
Optimización del kernel CUDA: MiniMax le pidió a MiniMax M3 que optimizara un kernel de multiplicación de matrices FP8 (GEMM) en las GPU con arquitectura NVIDIA Hopper. El modelo comenzó solo con una descripción de la tarea, un script de evaluación comparativa y un esqueleto de Triton no funcional; no se proporcionó ninguna implementación de referencia. Durante aproximadamente 24 horas, MiniMax M3 realizó 147 presentaciones de pruebas comparativas y 1959 llamadas de herramientas. Progresó a través de la implementación básica, la generación de configuración de ajuste automático, el diagnóstico de cuellos de botella en el rendimiento, la integración de CUDA Graph, la reescritura persistente del kernel y la optimización de la programación del lado del host. Después de seis rondas históricas de optimización, MiniMax M3 mejoró la utilización máxima del hardware Hopper FP8 del 7,6% al 71,3%, una aceleración de 9,4 veces. La mejor solución apareció en la presentación número 145. MiniMax señala que la mayoría de los otros modelos dejaron de hacer nuevos avances dentro de las primeras 30 presentaciones; sólo Opus 4.7 y M3 continuaron más allá de ese punto.
PostTrainBench (entrenamiento de modelos autónomos): MiniMax le dio a MiniMax M3 cuatro modelos base que solo habían completado el entrenamiento previo. MiniMax M3 ejecutó de forma autónoma el ciclo completo de síntesis de datos → entrenamiento → evaluación → iteración durante 12 horas sin intervención humana. El objetivo era que los modelos base adquirieran capacidades de razonamiento matemático (AIME2025), llamada de herramientas (BFCL), razonamiento de conocimiento científico (GPQA Main), razonamiento aritmético (GSM8K) y generación de código (HumanEval). MiniMax M3 obtuvo una puntuación de 0,37, por debajo de Opus 4.7 (0,42) y GPT-5.5 (0,39), pero por delante de los demás modelos probados.
Explicador visual de Marktechpost
Conclusiones clave
MiniMax M3 se lanzó el 1 de junio de 2026; La API ya está activa. MiniMax se ha comprometido a publicar los pesos de los modelos abiertos y un informe técnico en un plazo de 10 días. MSA (MiniMax Sparse Attention) ofrece más de 9 veces de precarga y más de 15 veces de velocidad de decodificación en un contexto de 1 millón de tokens en comparación con M2, a 1/20 del cálculo por token. M3 obtiene una puntuación del 59,0% en SWE-Bench Pro, superando a GPT-5.5 y Gemini 3.1 Pro. M3 es multimodal de forma nativa desde el paso 0, admite entrada de imágenes y videos y logra un 70,06 % en OSWorld-Verified para uso en computadora.
Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros