Meta Superintelligence Lab lanza Muse Spark: un modelo de razonamiento multimodal con compresión de pensamiento y agentes paralelos

Meta Superintelligence Labs recientemente dio un paso importante al presentar ‘Muse Spark’, el primer modelo de la familia Muse. Muse Spark es un modelo de razonamiento multimodal nativo compatible con el uso de herramientas, la cadena de pensamiento visual y la orquestación de múltiples agentes.

https://ai.meta.com/static-resource/muse-spark-eval-methodology

Lo que realmente significa ‘nativamente multimodal’

Cuando Meta describe a Muse Spark como “nativamente multimodal”, significa que el modelo fue entrenado desde cero para procesar y razonar a través de texto y entradas visuales simultáneamente, no un módulo de visión incorporado a un modelo de lenguaje después del hecho. Muse Spark está diseñado desde cero para integrar información visual en todos los dominios y herramientas, logrando un sólido rendimiento en preguntas STEM visuales, reconocimiento de entidades y localización.

Esta elección arquitectónica tiene consecuencias reales en las tareas que combinan lenguaje y visión. En el punto de referencia ScreenSpot Pro, que prueba la localización de capturas de pantalla, lo que requiere que el modelo identifique elementos específicos de la interfaz de usuario en las imágenes, Muse Spark obtiene una puntuación de 72,2 (84,1 con herramientas Python), en comparación con 57,7 de Claude Opus 4.6 Max (83,1 con Python) y 39,0 de GPT-5.4 Xhigh (85,4 con Python).

Tres ejes de escala: preentrenamiento, RL y razonamiento en el momento de la prueba

La parte técnicamente más interesante del anuncio de Muse Spark es el marco explícito de Meta en torno a tres ejes de escala: las palancas que están tirando para mejorar la capacidad del modelo de una manera predecible y mensurable. Para respaldar una mayor ampliación en los tres, Meta está realizando inversiones estratégicas en todo el conjunto, desde investigación y capacitación de modelos hasta infraestructura, incluido el centro de datos Hyperion.

El preentrenamiento es donde el modelo aprende sus conocimientos básicos del mundo, su razonamiento y sus habilidades de codificación. Durante los últimos nueve meses, Meta reconstruyó su pila de preentrenamiento con mejoras en la arquitectura del modelo, la optimización y la curación de datos. La recompensa son ganancias sustanciales de eficiencia: Meta puede alcanzar las mismas capacidades con un orden de magnitud menor que su modelo anterior, Llama 4 Maverick. Para los desarrolladores, “un orden de magnitud” significa aproximadamente 10 veces más eficiencia informática, una mejora importante que hace que los modelos futuros más grandes sean más viables desde el punto de vista financiero y práctico.

El Aprendizaje por Refuerzo (RL) es el segundo eje. Después del entrenamiento previo, se aplica RL para amplificar las capacidades entrenando el modelo con retroalimentación basada en resultados en lugar de solo predicción simbólica. Piénselo de esta manera: el entrenamiento previo le enseña al modelo hechos y patrones; RL le enseña a obtener las respuestas correctas. Aunque el RL a gran escala es notoriamente propenso a la inestabilidad, la nueva pila de Meta ofrece ganancias fluidas y predecibles. El equipo de investigación informa un crecimiento log-lineal en pass@1 y pass@16 en los datos de entrenamiento, lo que significa que el modelo mejora consistentemente a medida que la computación RL escala. pass@1 significa que el modelo obtiene la respuesta correcta en su primer intento; pass@16 significa al menos un éxito en 16 intentos, una medida de diversidad de razonamiento.

El razonamiento en el momento del examen es el tercer eje. Esto se refiere al cálculo que utiliza el modelo en el momento de la inferencia, el período en el que realmente genera una respuesta para un usuario. Muse Spark está entrenado para “pensar” antes de responder, un proceso que el equipo de investigación de Meta llama razonamiento en tiempo de prueba. Para ofrecer la mayor cantidad de inteligencia por token, el entrenamiento de RL maximiza la corrección, sujeto a una penalización en el tiempo para pensar. Esto produce un fenómeno que el equipo de investigación llama compresión del pensamiento: después de un período inicial en el que el modelo mejora al pensar más, la penalización de longitud provoca compresión del pensamiento: Muse Spark comprime su razonamiento para resolver problemas utilizando una cantidad significativamente menor de tokens. Después de comprimir, el modelo vuelve a ampliar sus soluciones para lograr un mayor rendimiento.

https://ai.meta.com/static-resource/muse-spark-eval-methodology

Modo de contemplación: orquestación de múltiples agentes en inferencia

Quizás la característica más interesante desde el punto de vista arquitectónico sea el modo Contemplación. El equipo de investigación lo describe como un novedoso andamio de escalamiento en tiempo de prueba de múltiples rondas que cubre la generación de soluciones, el autorrefinamiento iterativo y la agregación. En términos sencillos: en lugar de que un modelo genere una respuesta, varios agentes se ejecutan en paralelo, cada uno de los cuales produce soluciones que luego se refinan y agregan en un resultado final.

Mientras que el escalado estándar en tiempo de prueba hace que un solo agente piense durante más tiempo, el escalado de Muse Spark con pensamiento de múltiples agentes permite un rendimiento superior con una latencia comparable. Esta es una compensación clave de ingeniería: la latencia aumenta con la profundidad de una sola cadena de pensamiento, pero los agentes paralelos pueden agregar capacidad sin agregar proporcionalmente tiempo de espera.

En el modo Contemplación, Muse Spark obtiene una puntuación de 58,4 en el último examen con herramientas de la humanidad, un punto de referencia diseñado para evaluar el conocimiento multidisciplinario de nivel experto, en comparación con el 53,4 de Gemini 3.1 Deep Think y el 58,7 de GPT-5.4 Pro. En FrontierScience Research, Muse Spark Contemplating alcanza 38,3, por delante de los 36,7 de GPT-5.4 Pro y los 23,3 de Gemini 3.1 Deep Think.

Hacia dónde conduce Muse Spark y hacia dónde sigue

En cuanto a los puntos de referencia de salud, Muse Spark publica sus resultados más decisivos. En HealthBench Hard, un subconjunto de 1000 consultas de salud abiertas, Muse Spark obtiene una puntuación de 42,8, en comparación con 14,8 de Claude Opus 4.6 Max, 20,6 de Gemini 3.1 Pro High y 40,1 de GPT-5.4 Xhigh. Esto no es sólo suerte: para mejorar las capacidades de razonamiento de salud de Muse Spark, el equipo de investigación de Meta colaboró ​​con más de 1000 médicos para seleccionar datos de entrenamiento que permitan respuestas más objetivas y completas.

En los puntos de referencia de codificación, el panorama es más competitivo. En SWE-Bench Verified, donde los modelos deben resolver problemas reales de GitHub utilizando una herramienta bash y una herramienta de operación de archivos en una configuración de un solo intento con un promedio de más de 15 intentos por problema, Muse Spark obtiene una puntuación de 77,4, detrás de Claude Opus 4.6 Max con 80,8 y Gemini 3.1 Pro High con 80,6. En GPQA Diamond, un punto de referencia de razonamiento a nivel de doctorado promedió más de 4 ejecuciones para reducir la variación, Muse Spark obtiene una puntuación de 89,5, detrás de 92,7 de Claude Opus 4.6 Max y 94,3 de Gemini 3.1 Pro High.

La brecha más marcada aparece en ARC AGI 2, el punto de referencia de acertijos de razonamiento abstracto ejecutado en un conjunto público de 120 indicaciones informadas en pass@2. Muse Spark obtiene una puntuación de 42,5, muy por detrás de Gemini 3.1 Pro High con 76,5 y GPT-5.4 Xhigh con 76,1. Este es el punto débil actual más claro en el perfil de Muse Spark.

Conclusiones clave

Un nuevo comienzo de Meta, no una iteración: Muse Spark es el primer modelo de los recién formados Meta Superintelligence Labs, construido sobre una pila de preentrenamiento completamente reconstruida que es 10 veces más eficiente en computación que Llama 4 Maverick, lo que indica un reinicio deliberado de la estrategia de IA de Meta. La salud es la victoria principal en el punto de referencia: la ventaja más decisiva de Muse Spark sobre sus competidores está en el razonamiento de salud: puntuación de 42,8 en HealthBench Hard frente a los 14,8 de Claude Opus 4.6 Max y los 20,6 de Gemini 3.1 Pro High, respaldados por datos de entrenamiento seleccionados con más de 1000 médicos. El modo de contemplación cambia la computación paralela por una latencia más baja: en lugar de hacer que un solo modelo piense por más tiempo, lo que aumenta el tiempo de respuesta, el modo de contemplación de Muse Spark ejecuta múltiples agentes en paralelo que refinan y agregan respuestas, logrando un rendimiento competitivo en tareas de razonamiento difíciles sin una latencia proporcionalmente mayor. El razonamiento abstracto es el punto débil más claro. En ARC AGI 2, Muse Spark obtiene una puntuación de 42,5 frente a 76,5 de Gemini 3.1 Pro High y 76,1 de GPT-5.4 Xhigh, la mayor diferencia de rendimiento en toda la tabla de referencia.

Consulte los detalles técnicos y el documento. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros