MiniMax, la empresa de investigación de IA detrás de la pila de modelos omnimodales MiniMax, ha lanzado MMX-CLI: una interfaz de línea de comandos basada en Node.js que expone el conjunto completo de capacidades generativas de la plataforma de IA MiniMax, tanto para los desarrolladores humanos que trabajan en una terminal como para los agentes de IA que se ejecutan en herramientas como Cursor, Claude Code y OpenCode.
¿Qué problema está resolviendo MMX-CLI?
La mayoría de los agentes basados en modelos de lenguaje grande (LLM) actuales son buenos para leer y escribir texto. Pueden razonar sobre documentos, generar código y responder a instrucciones de varios turnos. Pero no tienen una ruta directa para generar medios: no tienen una forma integrada de sintetizar voz, componer música, renderizar un video o comprender una imagen sin una capa de integración separada como el Protocolo de Contexto Modelo (MCP).
Para crear esas integraciones, generalmente es necesario escribir contenedores de API personalizados, configurar herramientas del lado del servidor y administrar la autenticación por separado del marco de agente que esté utilizando. MMX-CLI se posiciona como un enfoque alternativo: exponer todas esas capacidades como comandos de shell que un agente puede invocar directamente, de la misma manera que lo haría un desarrollador desde una terminal, sin necesidad de pegamento MCP.
Las siete modalidades
MMX-CLI integra la pila modal completa de MiniMax en siete grupos de comandos generativos (texto mmx, imagen mmx, video mmx, voz mmx, música mmx, visión mmx y búsqueda mmx) además de utilidades de soporte (autenticación mmx, configuración mmx, cuota mmx, actualización mmx).
El comando de texto mmx admite chat de varios turnos, salida de transmisión, mensajes del sistema y modo de salida JSON. Acepta un indicador –model para apuntar a variantes específicas del modelo MiniMax, como MiniMax-M2.7-highspeed, con MiniMax-M2.7 como predeterminado. El comando de imagen mmx genera imágenes a partir de mensajes de texto con controles para la relación de aspecto (–aspect-ratio) y el recuento de lotes (–n). También admite un parámetro –subject-ref para la referencia del sujeto, que permite la coherencia de caracteres u objetos en múltiples imágenes generadas, lo que resulta útil para flujos de trabajo que requieren continuidad visual. El comando de video mmx utiliza MiniMax-Hailuo-2.3 como modelo predeterminado, con MiniMax-Hailuo-2.3-Fast disponible como alternativa. De forma predeterminada, mmx video generate envía un trabajo y realiza encuestas sincrónicamente hasta que el video esté listo. Pasar –async o –no-wait cambia este comportamiento: el comando devuelve un ID de tarea inmediatamente, lo que permite a la persona que llama verificar el progreso por separado a través de la tarea de video mmx get –task-id. El comando también admite un indicador –first-frame para la generación de video condicionado por imagen, donde se usa una imagen específica como cuadro inicial del video de salida. El comando de voz mmx expone la síntesis de texto a voz (TTS) con más de 30 voces disponibles, control de velocidad, ajuste de volumen y tono, salida de datos de temporización de subtítulos a través de subtítulos y soporte de reproducción en streaming a través de pipe a un reproductor multimedia. El modelo predeterminado es Speech-2.8-hd, con Speech-2.6 y Speech-02 como alternativas. La entrada tiene un límite de 10.000 caracteres. El comando mmx music, respaldado por el modelo music-2.5, genera música a partir de un mensaje de texto con controles de composición detallados que incluyen –vocals (por ejemplo, “barítono masculino cálido”), –genre, –mood, –instruments, –tempo, –bpm, –key y –structure. La bandera –instrumental genera música sin voces. También está disponible una marca –aigc-watermark para incrustar una marca de agua de contenido generada por IA en el audio de salida. mmx vision maneja la comprensión de imágenes a través de un modelo de visión y lenguaje (VLM). Acepta una ruta de archivo local o una URL remota (archivos locales con codificación base64 automáticamente) o una identificación de archivo MiniMax previamente cargada. Un indicador –prompt le permite hacer una pregunta específica sobre la imagen; el mensaje predeterminado es “Describe la imagen”. mmx search ejecuta una consulta de búsqueda web a través de la propia infraestructura de búsqueda de MiniMax y devuelve resultados en formato de texto o JSON.
Arquitectura Técnica
MMX-CLI está escrito casi en su totalidad en TypeScript (99,8% TS) con el modo estricto habilitado y utiliza Bun como tiempo de ejecución nativo para desarrollo y pruebas mientras se distribuye a npm para compatibilidad con entornos Node.js 18+. La validación del esquema de configuración utiliza Zod y la resolución sigue un orden de prioridad definido (indicadores CLI → variables de entorno → ~/.mmx/config.json → valores predeterminados), lo que hace que la implementación sea sencilla en entornos en contenedores o CI. El soporte de doble región está integrado en la capa de cliente API, enrutando a los usuarios globales a api.minimax.io y a los usuarios CN a api.minimaxi.com, conmutable a través de mmx config set –key region –value cn.
Conclusiones clave
MMX-CLI es la interfaz de línea de comandos abierta oficial de MiniMax que brinda a los agentes de IA acceso nativo a siete modalidades generativas (texto, imagen, video, voz, música, visión y búsqueda) sin requerir ninguna integración de MCP. Los agentes de IA que se ejecutan en herramientas como Cursor, Claude Code y OpenCode se pueden configurar con dos comandos y una única instrucción en lenguaje natural, después de lo cual el agente aprende la interfaz de comando completa por sí solo a partir de la documentación SKILL.md incluida. La CLI está diseñada para uso programático y de agentes, con indicadores dedicados para ejecución no interactiva, una separación stdout/stderr limpia para una tubería segura, códigos de salida estructurados para el manejo de errores y una función de exportación de esquemas que permite a los marcos de agentes registrar comandos mmx como definiciones de herramientas JSON. Para los desarrolladores de IA que ya están creando sistemas basados en agentes, reduce significativamente la barrera de integración al consolidar imágenes, videos, voz, música, visión y generación de búsqueda en una CLI única y bien documentada que los agentes pueden aprender y operar por sí mismos.
Consulte el repositorio aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Shobha es un analista de datos con una trayectoria comprobada en el desarrollo de soluciones innovadoras de aprendizaje automático que impulsan el valor empresarial.