Uni-MoE-2.0-Omni: un MoE omnimodal abierto basado en Qwen2.5-7B para la comprensión de texto, imágenes, audio y vídeo

¿Cómo se construye un modelo abierto que pueda comprender texto, imágenes, audio y video de manera confiable y al mismo tiempo funcionar de manera eficiente? Un equipo de investigadores del Instituto de Tecnología de Harbin, Shenzhen, presentó Uni-MoE-2.0-Omni, un gran modelo omnimodal completamente abierto que impulsa la línea Uni-MoE de Lychee hacia el razonamiento multimodal centrado en el lenguaje. El sistema se entrena desde cero en una columna vertebral densa de Qwen2.5-7B y se extiende a una arquitectura de mezcla de expertos con enrutamiento de capacidad dinámica, una receta de aprendizaje progresivo supervisado y de refuerzo, y alrededor de 75 mil millones de tokens de datos multimodales cuidadosamente combinados. Maneja texto, imágenes, audio y video para su comprensión y puede generar imágenes, texto y voz.

https://idealistxy.github.io/Uni-MoE-v2.github.io/

Arquitectura, modalidad unificada de codificación alrededor de un núcleo de lenguaje.

El núcleo de Uni-MoE-2.0-Omni es un transformador estilo Qwen2.5-7B que sirve como centro centrado en el lenguaje. Alrededor de este centro, el equipo de investigación adjunta un codificador de voz unificado que mapea audio diverso, incluido el sonido ambiental, el habla y la música, en un espacio de representación común. En el lado de la visión, los codificadores visuales previamente entrenados procesan imágenes y cuadros de video y luego introducen secuencias de tokens en el mismo transformador. Para la generación, un módulo TTS basado en MoE con reconocimiento del contexto y un transformador de difusión con reconocimiento de tareas manejan la síntesis de voz e imagen.

https://idealistxy.github.io/Uni-MoE-v2.github.io/

Todas las modalidades se convierten en secuencias de tokens que comparten una interfaz unificada con el modelo de lenguaje. Este diseño significa que las mismas capas de autoatención ven tokens de texto, visión y audio, lo que simplifica la fusión intermodal y convierte al modelo de lenguaje en el controlador central tanto para la comprensión como para la generación. La arquitectura está diseñada para admitir 10 configuraciones de entrada multimodal, como imagen más texto, vídeo más voz y combinaciones trimodales.

Fusión impulsada por RoPE y MoE 3D de modalidad omnidireccional

La alineación intermodal se maneja mediante un mecanismo Omni Modality 3D RoPE que codifica la estructura temporal y espacial directamente en las incrustaciones posicionales rotativas. En lugar de utilizar únicamente posiciones unidimensionales para el texto, el sistema asigna tres coordenadas a los tokens: tiempo, alto y ancho para transmisiones visuales y de audio, y tiempo para el habla. Esto le da al transformador una vista explícita de cuándo y dónde ocurre cada token, lo cual es importante para la comprensión del video y las tareas de razonamiento audiovisual.

Las capas Mixture of Experts reemplazan los bloques MLP estándar con una pila MoE que tiene tres tipos de expertos. Los expertos vacíos actúan como funciones nulas que permiten omitir el cálculo en el momento de la inferencia. Los expertos enrutados son específicos de una modalidad y almacenan conocimientos de dominio para audio, visión o texto. Los expertos compartidos son pequeños y siempre activos, lo que proporciona una vía de comunicación para información general entre modalidades. Una red de enrutamiento elige qué expertos activar en función del token de entrada, brindando especialización sin pagar el costo total de un modelo denso con todos los expertos activos.

Receta de entrenamiento, desde el preentrenamiento intermodal hasta GSPO DPO

El proceso de capacitación está organizado en una receta coincidente con datos. En primer lugar, una fase de preentrenamiento intermodal centrada en el lenguaje utiliza corpus de texto de imagen, texto de audio y texto de video emparejados. Este paso le enseña al modelo a proyectar cada modalidad en un espacio semántico compartido alineado con el lenguaje. El modelo base está entrenado con alrededor de 75 mil millones de tokens multimodales de código abierto y está equipado con tokens especiales de generación de voz e imágenes para que el comportamiento generativo pueda aprenderse condicionando señales lingüísticas.

A continuación, una etapa progresiva de ajuste fino supervisado activa expertos de modalidades específicas agrupados en categorías de audio, visión y texto. Durante esta etapa, el equipo de investigación introduce tokens de control especiales para que el modelo pueda realizar tareas como síntesis de voz condicionada por texto y generación de imágenes dentro de la misma interfaz de idioma. Después de SFT (ajuste fino supervisado) a gran escala, una fase de recocido equilibrado de datos vuelve a ponderar la mezcla de conjuntos de datos entre modalidades y tareas y entrena con una tasa de aprendizaje más baja. Esto evita el ajuste excesivo a una única modalidad y mejora la estabilidad del comportamiento omnimodal final.

Para desbloquear el razonamiento extenso, Uni-MoE-2.0-Omni agrega una etapa iterativa de optimización de políticas basada en GSPO y DPO. GSPO utiliza el modelo mismo u otro LLM como juez para evaluar las respuestas y construir señales de preferencia, mientras que DPO convierte estas preferencias en un objetivo directo de actualización de políticas que es más estable que el aprendizaje por refuerzo estándar a partir de la retroalimentación humana. El equipo de investigación aplica este bucle GSPO DPO en múltiples rondas para formar la variante Uni-MoE-2.0-Thinking, que hereda la base omnimodal y agrega un razonamiento paso a paso más sólido.

Generación, MoE TTS y difusión consciente de tareas

Para la generación de voz, Uni-MoE-2.0-Omni utiliza un módulo MoE TTS consciente del contexto que se encuentra encima del modelo de lenguaje. El LLM emite tokens de control que describen el timbre, el estilo y el lenguaje, junto con el contenido del texto. El MoE TTS consume esta secuencia y produce tokens de audio discretos, que luego se decodifican en formas de onda mediante un modelo de códec externo, alineándose con el codificador de voz unificado en el lado de entrada. Este diseño hace que la generación de voz sea una tarea de generación controlada de primera clase en lugar de una canalización separada.

En el lado de la visión, un transformador de difusión consciente de la tarea está condicionado tanto a los tokens de tarea como a los tokens de imagen. Los tokens de tarea codifican si el sistema debe realizar la generación, edición o mejora de bajo nivel de texto a imagen. Los tokens de imagen pueden capturar la semántica de la columna vertebral omnimodal, por ejemplo, de un diálogo de texto más imagen. Los proyectores livianos asignan estos tokens al espacio de acondicionamiento del transformador de difusión, lo que permite la generación y edición de imágenes guiadas por instrucciones, mientras mantiene congelado el modelo omnimodal principal durante la etapa final de ajuste visual.

Puntos de referencia y puntos de control abiertos

Uni-MoE-2.0-Omni se evalúa en 85 puntos de referencia multimodales que cubren imagen, texto, video, audio y razonamiento cruzado o trimodal. El modelo supera a Qwen2.5-Omni, que se entrena con aproximadamente 1,2 T de tokens, en más de 50 de 76 puntos de referencia compartidos. Las ganancias incluyen alrededor de +7 % en promedio en comprensión de video en 8 tareas, +7 % en promedio en comprensión de omnimodalidad en 4 puntos de referencia, incluidos OmniVideoBench y WorldSense, y alrededor de +4 % en razonamiento audiovisual.

Para el procesamiento de voz de formato largo, Uni-MoE-2.0-Omni reduce la tasa de error de palabras hasta en un 4,2 % en relación con las divisiones largas de LibriSpeech y aporta aproximadamente un 1 % de mejora WER en texto a voz de TinyStories-en. Los resultados de generación y edición de imágenes son competitivos con los modelos visuales especializados. El equipo de investigación informa una ganancia pequeña pero constante de aproximadamente el 0,5% en GEdit Bench en comparación con Ming Lite Omni, al mismo tiempo que supera a Qwen Image y PixWizard en varias métricas de procesamiento de imágenes de bajo nivel.

https://arxiv.org/pdf/2511.12609

Conclusión clave

Uni-MoE-2.0-Omni es un modelo grande omnimodal completamente abierto construido desde cero sobre una columna vertebral densa Qwen2.5-7B, actualizado a una arquitectura Mixture of Experts que admite 10 tipos de entrada intermodales y comprensión conjunta de texto, imágenes, audio y video. El modelo introduce un MoE de capacidad dinámica con expertos compartidos, enrutados y nulos más Omni Modality 3D RoPE, que en conjunto equilibran la computación y la capacidad al enrutar expertos por token mientras mantienen la alineación espacio-temporal entre las modalidades dentro de las capas de autoatención. Uni-MoE-2.0-Omni utiliza un proceso de capacitación por etapas, preentrenamiento intermodal, ajuste fino supervisado progresivo con expertos en modalidades específicas, recocido equilibrado de datos y aprendizaje de refuerzo basado en GSPO más DPO para obtener la variante Uni-MoE-2.0-Thinking para un razonamiento de formato largo más sólido. El sistema admite la comprensión y generación omnimodal de imágenes, texto y voz a través de una interfaz centrada en el lenguaje unificado, con cabezales Uni-MoE-TTS y Uni-MoE-2.0-Image dedicados derivados de la misma base para síntesis controlable de voz e imágenes. En 85 puntos de referencia, Uni-MoE-2.0-Omni supera a Qwen2.5-Omni en más de 50 de 76 tareas compartidas, con ganancias de alrededor de +7 % en comprensión de video y comprensión de omnimodalidad, +4 % en razonamiento audiovisual y hasta un 4,2 % de reducción relativa de WER en discurso de formato largo.

Consulte la página de papel, repositorio, pesos de modelo y proyecto. No dude en consultar nuestra página de GitHub para tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 100.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

Asif Razzaq es el director ejecutivo de Marktechpost Media Inc.. Como empresario e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.

🙌 Siga MARKTECHPOST: agréguenos como fuente preferida en Google.