MiniMax lanza MiniMax M3 con arquitectura MSA que admite contexto de 1 millón de tokens, multimodalidad nativa y codificación agente

MiniMax lanzó oficialmente MiniMax M3 el 1 de junio de 2026. El modelo presenta MSA (MiniMax Sparse Attention), una nueva arquitectura de atención dispersa que le da a M3 una ventana de contexto de 1 millón de tokens. M3 también admite de forma nativa la entrada de imágenes y vídeos y el funcionamiento de una computadora de escritorio. La API ya está activa.

MiniMax M3 está disponible hoy a través del Código MiniMax, el Plan de token MiniMax y la API MiniMax. Es el siguiente modelo de la línea de la serie M después del M2.7. MiniMax posiciona a M3 como un modelo de peso abierto que combina rendimiento de codificación de nivel fronterizo, una ventana de contexto de 1 millón de tokens y entrada multimodal nativa en una sola arquitectura: el primero en hacerlo, según MiniMax. Los pesos del modelo correspondientes y el informe técnico están programados para publicarse dentro de los 10 días posteriores al lanzamiento.

MSA: Atención escasa MiniMax

El cambio arquitectónico central en MiniMax M3 es MSA (MiniMax Sparse Attention). La atención total estándar tiene una complejidad computacional cuadrática: a medida que crece la longitud del contexto, el costo de cómputo crece como el cuadrado de la longitud de la secuencia. MSA está diseñado para abordar esto.

Los mecanismos de atención dispersa generalmente agregan una etapa de filtrado previo antes de calcular la atención, evitando el costo cuadrático total. El equipo de MiniMax afirma que, en comparación con enfoques como DSA y MoBA, MSA divide la caché KV en bloques con mayor precisión, logrando una mayor cobertura de contexto efectiva.

A nivel de operador, MSA utiliza un enfoque de “recogida exterior KV Q”. Los bloques KV sirven como bucle externo para agregar las consultas que los afectan. Cada bloque se lee solo una vez y el acceso a la memoria es contiguo. El equipo de MiniMax informa que esto es más de 4 veces más rápido que las implementaciones de código abierto como Flash-Sparse-Attention y flash-moba bajo la configuración principal de MiniMax M3.

El resultado: en una longitud de contexto de 1 millón de tokens, el cálculo por token de MiniMax M3 es 1/20 del de los modelos M2 de la generación anterior. El equipo de MiniMax informa una aceleración de más de 9 veces en la etapa de precarga y de más de 15 veces en la etapa de decodificación en un contexto de 1 millón de tokens. En múltiples estudios de ablación, MSA prestó total atención a la mayoría de las capacidades.

Codificación y puntos de referencia agentes

Las capacidades de codificación y agencia son áreas clave de mejora para M3. Los resultados de las pruebas comparativas a continuación son informados por el equipo de MiniMax. Se realizaron varias evaluaciones en la infraestructura interna de MiniMax, mientras que algunas puntuaciones comparativas se tomaron de tablas de clasificación oficiales o fuentes de referencia externas, como se indica en la metodología de MiniMax. SWE-Bench Verified se probó en infraestructura interna utilizando andamios de Claude Code y se promedió en 4 ejecuciones. SWE-Bench Pro también se probó en infraestructura interna utilizando andamios de Claude Code, con una lógica de prueba alineada con la evaluación oficial.

SWE-Bench Pro: 59,0 % (supera GPT-5.5 y Gemini 3.1 Pro; se acerca a Opus 4.7) Terminal-Bench 2.1: 66,0 % SWE-fficiency: 34,8 % KernelBench Hard: 28,8 % (evaluado en GPU NVIDIA Blackwell, capacidad CUDA sm_120) MCP Atlas: 74,2 % Claw-Eval: puntuación más alta entre los modelos evaluados (Grupo de tareas general, 161 tareas) SVG-Bench: supera a Opus 4.7

En OmniDocBench, un punto de referencia de comprensión de documentos multimodal, M3 obtiene una puntuación superior a Gemini 3.1 Pro. En OSWorld-Verified (361 muestras), M3 logra una tasa de finalización de tareas del 70,06 % para el uso de la computadora (pasos máximos = 200).

MiniMax también creó un marco de simulación de usuario interactivo para capacitación y evaluación. Simula la colaboración de desarrolladores en múltiples turnos: elaboración de requisitos, discusión de soluciones, corrección basada en comentarios, cambio continuo de tareas e iteración de proyectos en múltiples rondas. Esto tiene como objetivo reducir la brecha entre el rendimiento de referencia de un solo turno y los flujos de trabajo de desarrolladores de múltiples turnos del mundo real.

Multimodalidad Nativa

MiniMax M3 se sometió a un entrenamiento de modalidad mixta desde el paso 0. El texto, las imágenes y el video se entrenan juntos desde el principio en lugar de agregarse después del entrenamiento. El equipo de MiniMax informa que los datos entrelazados (secuencias en las que el texto y las imágenes se mezclan de forma natural) son más críticos para el rendimiento del modelo de lo que comúnmente se supone. Después de reconstruir todo el proceso de datos para formatos intercalados, los datos de entrenamiento se ampliaron al orden de 100 billones de tokens.

MiniMax M3 admite entrada de imágenes y videos y puede operar una computadora de escritorio.

Ejemplos de tareas del mundo real de MiniMax

MiniMax documenta tres tareas internas en la publicación de lanzamiento:

Reproducción en papel: MiniMax otorgó a MiniMax M3 el artículo ganador del premio ICLR 2025 Outstanding Paper Award Learning Dynamics of LLM Finetuning y le pidió que reprodujera los experimentos de forma independiente. M3 funcionó de forma autónoma durante casi 12 horas, produjo 18 confirmaciones y 23 figuras experimentales y completó los experimentos principales sin intervención humana. Requería capacidad multimodal para leer curvas y fórmulas, un contexto largo para contener el papel y los registros de experimentos simultáneamente, y capacidad de codificación para ejecutar la reproducción a través de un hilo largo.

Optimización del kernel CUDA: MiniMax le pidió a MiniMax M3 que optimizara un kernel de multiplicación de matrices FP8 (GEMM) en las GPU con arquitectura NVIDIA Hopper. El modelo comenzó solo con una descripción de la tarea, un script de evaluación comparativa y un esqueleto de Triton no funcional; no se proporcionó ninguna implementación de referencia. Durante aproximadamente 24 horas, MiniMax M3 realizó 147 presentaciones de pruebas comparativas y 1959 llamadas de herramientas. Progresó a través de la implementación básica, la generación de configuración de ajuste automático, el diagnóstico de cuellos de botella en el rendimiento, la integración de CUDA Graph, la reescritura persistente del kernel y la optimización de la programación del lado del host. Después de seis rondas históricas de optimización, MiniMax M3 mejoró la utilización máxima del hardware Hopper FP8 del 7,6% al 71,3%, una aceleración de 9,4 veces. La mejor solución apareció en la presentación número 145. MiniMax señala que la mayoría de los otros modelos dejaron de hacer nuevos avances dentro de las primeras 30 presentaciones; sólo Opus 4.7 y M3 continuaron más allá de ese punto.

PostTrainBench (entrenamiento de modelos autónomos): MiniMax le dio a MiniMax M3 cuatro modelos base que solo habían completado el entrenamiento previo. MiniMax M3 ejecutó de forma autónoma el ciclo completo de síntesis de datos → entrenamiento → evaluación → iteración durante 12 horas sin intervención humana. El objetivo era que los modelos base adquirieran capacidades de razonamiento matemático (AIME2025), llamada de herramientas (BFCL), razonamiento de conocimiento científico (GPQA Main), razonamiento aritmético (GSM8K) y generación de código (HumanEval). MiniMax M3 obtuvo una puntuación de 0,37, por debajo de Opus 4.7 (0,42) y GPT-5.5 (0,39), pero por delante de los demás modelos probados.

Explicador visual de Marktechpost

Descripción general

MiniMax M3: codificación de frontera, contexto de 1 millón de tokens, multimodalidad nativa

MiniMax lanzó oficialmente el M3 el 1 de junio de 2026 . La API ya está activa. Los pesos de los modelos y el informe técnico estarán disponibles en un plazo de 10 días.

El M3 es el siguiente modelo de la serie M después del M2.7. MiniMax lo posiciona como el primer modelo de peso abierto que combina los tres siguientes en una sola arquitectura:

Ventana de contexto de token de 1 millón

59,0 % de puntuación SWE-Bench Pro

Arquitectura de atención dispersa de MSA

70,06% verificado por OSWorld (uso de computadora)

Arquitectura

MSA: Atención escasa MiniMax

La atención total estándar tiene una complejidad computacional cuadrática. A medida que crece la longitud del contexto, el costo de cálculo crece como el cuadrado de la longitud de la secuencia. MSA está diseñado para resolver esto a nivel de operador.

En comparación con enfoques como DSA y MoBA, MSA divide la caché KV en bloques con mayor precisión, logrando una mayor cobertura de contexto efectiva.

MSA utiliza un enfoque de "reunión externa de KV Q": cada bloque de KV se lee solo una vez, el acceso a la memoria es contiguo y la intensidad aritmética es significativamente mejor que los métodos comunes.

>9× Aceleración de precarga a 1M ctx

>15× Aceleración de decodificación a 1M ctx

1/20 de cálculo por token frente a M2 a 1M

>4 veces más rápido que Flash-Sparse-Attn

Puntos de referencia

Codificación y rendimiento agente

Resultados informados por MiniMax. Andamios Claude Code usados ​​verificados por SWE-Bench, con un promedio de 4 ejecuciones. SWE-Bench Pro utilizó el andamio Claude Code, alineado con la evaluación oficial.

SWE-Bench Pro: 59,0%: supera a GPT-5.5 y Gemini 3.1 Pro; se acerca a Opus 4.7 Terminal-Bench 2.1: 66,0 % Eficiencia SWE: 34,8 % KernelBench Hard: 28,8 % — evaluado en GPU NVIDIA Blackwell (sm_120) MCP Atlas: 74,2 % Claw-Eval: puntuación más alta entre los modelos evaluados (161 tareas) SVG-Bench: supera a Opus 4.7 OmniDocBench: por encima de Gemini 3.1 Pro OSWorld-Verified: 70,06%: 361 muestras, pasos máximos = 200

Multimodalidad

Entrenamiento multimodal nativo desde el paso 0

M3 se sometió a un entrenamiento de modalidad mixta desde el paso 0. El texto, las imágenes y el video se entrenan juntos desde el principio, no se agregan como una capacidad posterior al entrenamiento.

MiniMax informa que los datos entrelazados (secuencias en las que el texto y las imágenes se mezclan naturalmente) son más críticos para el rendimiento del modelo de lo que comúnmente se supone.

Después de reconstruir toda la canalización de datos para formatos intercalados, los datos de entrenamiento se ampliaron al orden de 100 billones de tokens .

Entrada de imagen Entrada de vídeo Operación de computadora de escritorio (uso de computadora)

Tareas del mundo real

Tres tareas internas documentadas por MiniMax

Reproducción de papel: M3 reprodujo el documento ICLR 2025 Learning Dynamics of LLM Finetuning de forma autónoma durante aproximadamente 12 horas, produciendo 18 confirmaciones y 23 figuras experimentales sin intervención humana. Optimización del kernel CUDA: M3 optimizó un kernel GEMM FP8 en GPU NVIDIA Hopper durante aproximadamente 24 horas: 147 envíos de pruebas comparativas, 1959 llamadas a herramientas, 6 rondas de optimización históricas. Se mejoró la utilización máxima de Hopper FP8 del 7,6 % al 71,3 % (aceleración de 9,4 veces). La mejor solución apareció en la presentación 145. PostTrainBench: M3 ejecutó de forma autónoma síntesis de datos → entrenamiento → evaluación → iteración para 4 modelos base durante 12 horas. Obtuvo una puntuación de 0,37, por debajo de Opus 4.7 (0,42) y GPT-5.5 (0,39), pero por delante de otros modelos evaluados. Objetivos: AIME2025, BFCL, GPQA Main, GSM8K, HumanEval.

Código MiniMax

Código MiniMax: Producto agente creado y capacitado con M3

MiniMax Code es un producto de agente creado y capacitado junto con M3. Disponible en agent.minimaxi.com/download . Funciona con planes de token MiniMax.

Equipos de agentes: múltiples agentes ejecutan flujos de trabajo simultáneos, de múltiples etapas y dinámicamente ajustables. Bucle de productor + verificador: el arnés adversario permite la autocorrección continua durante la ejecución. Uso de la computadora: la capacidad multimodal nativa de M3 permite la automatización de escritorio entre aplicaciones. Construido sobre OpenCode y Pi: MiniMax afirma que planea abrir el código MiniMax en el futuro.

// Caso de uso de ejemplo Usuario (por teléfono): "Abra el cliente ERP local e ingrese por lotes los datos de la factura desde este archivo de Excel". → MiniMax Code maneja operaciones entre aplicaciones, archivos y sistemas en el escritorio.

API y precios

Detalles de API y niveles del plan de tokens

La API M3 está disponible en platform.minimax.io .

Precios por longitud de entrada: Llamadas ≤512K tokens → tarifa estándar. Llamadas >512K → tasa de contexto largo más alta.

Modo de pensamiento: active o desactive en el momento de la solicitud. Ambos modos comparten el mismo precio.

Niveles de servicio: estándar (predeterminado) y prioridad (service_tier=priority): prioridad disponible a través de ventas y próximamente disponible para todos los usuarios.

Más ~1.700 millones de tokens/mes $20/mes

Máximo ~5.100 millones de tokens/mes $50/mes

Ultra ~9.800 millones de tokens/mes $120/mes

El uso de texto, imágenes, voz y música proviene del mismo grupo de tokens.

Conclusiones clave

Lo que los ingenieros e investigadores necesitan saber

MiniMax M3 se lanzó el 1 de junio de 2026. La API está activa. Pesos modelo abiertos e informe técnico comprometido en un plazo de 10 días. MSA ofrece >9× de precarga y >15× de velocidad de decodificación en un contexto de 1 millón de tokens frente a M2, a 1/20 del cálculo por token. M3 obtiene una puntuación del 59,0% en SWE-Bench Pro, superando a GPT-5.5 y Gemini 3.1 Pro. Nativamente multimodal desde el paso 0: admite entrada de imágenes y video y 70,06 % en OSWorld-Verified para uso en computadora. Modo de pensamiento conmutable en el momento de la solicitud. El plan de tokens comienza en $20/mes (~1.700 millones de tokens M3).

Conclusiones clave

MiniMax M3 se lanzó el 1 de junio de 2026; La API ya está activa. MiniMax se ha comprometido a publicar los pesos de los modelos abiertos y un informe técnico en un plazo de 10 días. MSA (MiniMax Sparse Attention) ofrece más de 9 veces de precarga y más de 15 veces de velocidad de decodificación en un contexto de 1 millón de tokens en comparación con M2, a 1/20 del cálculo por token. M3 obtiene una puntuación del 59,0% en SWE-Bench Pro, superando a GPT-5.5 y Gemini 3.1 Pro. M3 es multimodal de forma nativa desde el paso 0, admite entrada de imágenes y videos y logra un 70,06 % en OSWorld-Verified para uso en computadora.

Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros