MiniMax lanza MiniMax-Music3: un modelo musical de pesos abiertos que genera canciones completas de cinco minutos a partir de letras y subtítulos estructurados

MiniMax lanzó MiniMax-Music3, un modelo de conversión de texto a música de peso abierto. El modelo toma dos entradas separadas: letras con etiquetas de sección y una descripción musical detallada. Devuelve una canción completa de hasta cinco minutos en una sola generación, como WAV estéreo de 32 kHz y 16 bits. La arquitectura combina un Hybrid-LM, un 8B Global LLM con un 0.6B LLM local, con una pila de síntesis continua basada en la coincidencia de flujo y un Flow-VAE. Los pesos, el código de inferencia y tres rutas de servicio documentadas se enviaron el mismo día.

¿Es desplegable?

Sí, MiniMax publicó pesos utilizables, código de inferencia y tres rutas de servicio documentadas el primer día, por lo que esto se puede implementar ahora en lugar de una vista previa de la investigación.

Nivel de empresa: los creadores en solitario, los estudios independientes y los equipos del mercado medio pueden realizar envíos directamente. La licencia comunitaria MiniMax-Music3 permite el uso comercial, pero requiere que usted muestre ‘MiniMax-Music3’ de manera destacada en la interfaz de usuario del producto, y cualquier organización cuyos ingresos anuales totales de esos productos superen los 20 millones de dólares estadounidenses debe obtener una autorización previa por escrito de MiniMax. Cualquiera que aloje generación de terceros también debe implementar y mantener salvaguardias contra resultados infractores. Industrias: desarrollo de juegos, agencias de publicidad y marcas, videos de formato corto y herramientas para creadores, aprendizaje electrónico, podcasting, aplicaciones de fitness y bienestar, audio minorista en tiendas y SaaS de tecnología musical. Aplicaciones: puntuación de fondo para videos UGC, juegos adaptables y música de nivel, anuncios localizados y marcas sonoras, pistas scratch y de demostración para compositores, generación de listas de reproducción condicionadas por el estado de ánimo y generación de lotes fuera de línea donde el costo de API por canción es la limitación.

La Arquitectura

MiniMax-Music3 combina una pila autorregresiva jerárquica con una ruta de síntesis continua.

El tokenizador de entrenamiento utiliza ocho capas de cuantificación de vector residual (RVQ). El primer libro de códigos semántico tiene 16.384 entradas y contiene estructura y semántica musical central. Los siete libros de códigos acústicos restantes tienen 1.024 entradas cada uno y codifican detalles residuales. El entrenamiento optimiza primero la capa semántica y luego las ocho juntas.

El Hybrid-LM divide el problema del modelado. Un 8B Global LLM predice el primer libro de códigos RVQ cuadro por cuadro y mantiene una estructura de largo alcance; un LLM local de 0.6B predice los libros de códigos restantes dentro de cada cuadro. La tarjeta modelo y la licencia indican que Global LLM se inicializa desde Qwen3-8B; la publicación de MiniMax Research dice Qwen3.5-8B, así que trate el punto de control base exacto como inestable.

La etapa de síntesis es la opción de diseño más interesante. En lugar de decodificar a partir de tokens RVQ discretos, MiniMax fusiona los estados ocultos finales de ambos LLM y les condiciona un módulo de coincidencia de flujo de 2.4B, que se asigna a un espacio latente decodificado por un Flow-VAE de 123M heredado de MiniMax Speech. En la inferencia, el decodificador del tokenizador discreto no se carga en absoluto.

Control de dos entradas

Las letras llevan las palabras y las etiquetas de sección en sus propias líneas: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro]. Un título estructurado independiente incluye metadatos globales, detalles vocales y disposición. MiniMax también incluye una habilidad de agente de reescritura de subtítulos de música que expande una breve descripción a ese formato de tres partes sin conexión.

Explicador interactivo

‘; si(yo