Apenas unos meses después del lanzamiento de M2, un modelo rápido y de bajo costo diseñado para agentes y código, MiniMax presentó una versión mejorada: MiniMax M2.1.
M2 ya destacaba por su eficiencia, funcionando a aproximadamente el 8% del coste de Claude Sonnet y ofreciendo una velocidad significativamente mayor. Más importante aún, introdujo un patrón computacional y de razonamiento diferente, particularmente en cómo el modelo estructura y ejecuta su pensamiento durante código complejo y flujos de trabajo basados en herramientas.
M2.1 se basa en esta base y aporta mejoras tangibles en áreas clave: mejor calidad del código, seguimiento de instrucciones más inteligente, razonamiento más limpio y rendimiento más sólido en múltiples lenguajes de programación. Estas actualizaciones amplían las fortalezas originales de M2 y al mismo tiempo se mantienen fieles a la visión de MiniMax de "Inteligencia con todos".
Fortalecer las capacidades centrales de M2, M2.1 ya no se trata solo de mejorar la codificación, sino que también produce resultados más claros y estructurados en conversaciones, documentación y escritura.
Creado para equipos nativos de IA y codificación del mundo real: diseñado para admitir todo, desde rápidas "construcciones de vibraciones" hasta flujos de trabajo complejos de nivel de producción. Va más allá de la codificación: produce resultados más claros, estructurados y de mayor calidad en conversaciones cotidianas, documentación técnica y tareas de escritura. Rendimiento de codificación multilingüe de última generación: alcanza el 72,5 % en SWE-Multilingual, superando a Claude Sonnet 4.5 y Gemini 3 Pro en múltiples lenguajes de programación. Fuertes capacidades de AppDev y WebDev: obtiene una puntuación del 88,6 % en VIBE-Bench, superando a Claude Sonnet 4.5 y Gemini 3 Pro, con importantes mejoras en Android nativo, iOS y desarrollo web moderno. Excelente compatibilidad con agentes y herramientas: ofrece un rendimiento consistente y estable en las principales herramientas de codificación y marcos de agentes, incluidos Claude Code, Droid (Factory AI), Cline, Kilo Code, Roo Code, BlackBox y más. Sólido soporte de gestión de contexto: funciona de manera confiable con mecanismos de contexto avanzados como Skill.md, Claude.md/agent.md/cursorrule y Slash Commands, lo que permite flujos de trabajo de agentes escalables. Almacenamiento en caché automático, configuración cero: el almacenamiento en caché integrado funciona desde el primer momento para reducir la latencia, disminuir los costos y brindar una experiencia general más fluida.
Para comenzar con MiniMax M2.1, necesitará una clave API de la plataforma MiniMax. Puede generar uno desde la consola de usuario de MiniMax.
Una vez emitida, almacene la clave API de forma segura y evite exponerla en repositorios de código o entornos públicos.
Instalación y configuración de las dependencias
MiniMax admite los formatos API Anthropic y OpenAI, lo que facilita la integración de modelos MiniMax en flujos de trabajo existentes con cambios mínimos de configuración, ya sea que esté utilizando API de mensajes de estilo Anthropic o configuraciones compatibles con OpenAI.
Con solo esta configuración mínima, estará listo para comenzar a usar el modelo.
Envío de solicitudes al modelo
MiniMax M2.1 devuelve resultados estructurados que separan el razonamiento interno (pensamiento) de la respuesta final (texto). Esto le permite observar cómo el modelo interpreta la intención y planifica su respuesta antes de producir el resultado de cara al usuario.
Lo que distingue a MiniMax es la visibilidad de su proceso de razonamiento. Antes de producir la respuesta final, el modelo razona explícitamente sobre la intención, el tono y el estilo esperado del usuario, asegurando que la respuesta sea apropiada y tenga en cuenta el contexto.
Al separar claramente el razonamiento de las respuestas, el modelo se vuelve más fácil de interpretar, depurar y confiar, especialmente en flujos de trabajo complejos basados en agentes o de varios pasos, y con M2.1 esta claridad se combina con respuestas más rápidas, razonamientos más concisos y un consumo de tokens sustancialmente reducido en comparación con M2.
MiniMax M2 se destaca por su dominio nativo del pensamiento entrelazado, lo que le permite planificar y adaptarse dinámicamente dentro de codificación compleja y flujos de trabajo basados en herramientas, y M2.1 amplía esta capacidad con una calidad de código mejorada, un seguimiento de instrucciones más preciso, un razonamiento más claro y un rendimiento más sólido en todos los lenguajes de programación, particularmente en el manejo de restricciones de instrucciones compuestas como se ve en OctoCodingBench, lo que lo prepara para la automatización de oficinas.
Para evaluar estas capacidades en la práctica, probemos el modelo utilizando un mensaje de codificación estructurado que incluye múltiples restricciones y requisitos de ingeniería del mundo real.
Esta prueba utiliza un mensaje deliberadamente estructurado y con muchas restricciones diseñado para evaluar algo más que la generación de código. El mensaje requiere una estricta validación de entrada, administración del estado en memoria, seguridad de subprocesos, capacidad de prueba y extensibilidad, todo sin depender de bibliotecas externas.
Al combinar decisiones arquitectónicas con múltiples restricciones no triviales, el indicador opera en un nivel de complejidad medio a alto, lo que lo hace muy adecuado para evaluar la eficacia con la que MiniMax M2.1 sigue instrucciones, razona a través de compensaciones de diseño y produce código con calidad de producción en lugar de fragmentos aislados.
Razonamiento y resultado del modelo
El modelo razona a través de compensaciones arquitectónicas clave antes de codificar, equilibrando cuidadosamente la flexibilidad, el uso de memoria y la extensibilidad. Evalúa múltiples enfoques para la agregación de eventos y elige deliberadamente el almacenamiento de eventos sin procesar para permitir extensiones futuras sin modificar la lógica de ingesta.
La seguridad de los subprocesos se maneja explícitamente mediante el bloqueo, y se planea una validación de entrada estricta para garantizar la exactitud de los datos, lo que refleja una mentalidad del mundo real que da prioridad a la ingeniería en lugar de saltar directamente a la implementación.
Este razonamiento reflexivo se refleja en el resultado final, que demuestra una sólida calidad del código a través de una estructura clara, nombres significativos, sugerencias de tipografía y un diseño seguro para subprocesos alineado con los estándares de producción. La solución sigue todas las restricciones de aviso con precisión (que abarcan la validación, la agregación en memoria, la extensibilidad y la ausencia de dependencias externas) al tiempo que mantiene una lógica limpia y enfocada que evita complejidades innecesarias y sigue siendo fácil de mantener.
Veamos ahora el pensamiento entrelazado de MiniMax M2.1 en acción. Le pedimos al modelo que compare dos organizaciones según la relación P/E y el sentimiento, utilizando dos herramientas ficticias para observar claramente cómo funciona el flujo de trabajo.
Este ejemplo demuestra cómo M2.1 interactúa con herramientas externas en una configuración controlada de estilo agente. Una herramienta simula la obtención de métricas bursátiles, mientras que la otra proporciona un análisis de sentimiento y ambas devuelven respuestas generadas localmente. A medida que el modelo recibe los resultados de estas herramientas, los incorpora a su razonamiento y ajusta su comparación final en consecuencia.
Definiendo las herramientas
Durante la ejecución, el modelo decide cuándo y qué herramienta llamar, recibe los resultados de la herramienta correspondiente y luego actualiza su razonamiento y respuesta final en función de esos datos. Esto muestra la capacidad de M2.1 para intercalar razonamiento, uso de herramientas y generación de respuestas, adaptando su salida dinámicamente a medida que hay nueva información disponible.
Finalmente, comparamos MiniMax M2.1 con GPT-5.2 utilizando un mensaje compacto multilingüe de seguimiento de instrucciones. La tarea requiere que el modelo identifique términos relacionados con el café de un pasaje en español, traduzca solo esos términos al inglés, elimine duplicados y devuelva el resultado en una lista numerada con formato estricto.
Para ejecutar este bloque de código, necesitará una clave API de OpenAI, que se puede generar desde el panel de desarrollador de OpenAI.
Al comparar los resultados, MiniMax M2.1 produce un conjunto de términos relacionados con el café notablemente más amplio y granular que GPT-5.2. M2.1 identifica no sólo sustantivos centrales como café, granos y agua, sino también acciones de preparación (verter, revolver, cubrir), estados relacionados con el proceso (sumergido, remojo) y atributos contextuales (frío, grueso, fuerza, horas).
Esto indica un paso semántico más profundo sobre el texto, donde el modelo analiza todo el flujo de trabajo de preparación en lugar de extraer solo las palabras clave más obvias.
Esta diferencia también se refleja en el proceso de razonamiento. M2.1 analiza explícitamente el contexto, resuelve casos extremos (como términos prestados en inglés como Cold Brew), considera duplicados y delibera sobre si ciertos adjetivos o verbos califican como relacionados con el café antes de finalizar la lista. GPT-5.2, por el contrario, ofrece un resultado más breve y conservador centrado en términos de alta confianza, con una profundidad de razonamiento menos visible.
En conjunto, esto resalta la mayor adherencia a las instrucciones y la cobertura semántica de M2.1, especialmente para tareas que requieren un filtrado cuidadoso, traducción y un estricto control de salida.
Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.