El panorama de los modelos multimodales de lenguaje grande (MLLM) ha pasado de ‘envoltorios’ experimentales (en los que codificadores de audio o visión separados se unen a una columna vertebral basada en texto) a arquitecturas ‘omnimodales’ nativas de extremo a extremo. El último lanzamiento del equipo Alibaba Qwen, Qwen3.5-Omni, representa un hito importante en esta evolución. Diseñada como un competidor directo de modelos emblemáticos como Gemini 3.1 Pro, la serie Qwen3.5-Omni presenta un marco unificado capaz de procesar texto, imágenes, audio y video simultáneamente dentro de un único canal computacional.
La importancia técnica de Qwen3.5-Omni radica en su arquitectura Thinker-Talker y su uso de una combinación de expertos (MoE) de atención híbrida en todas las modalidades. Este enfoque permite que el modelo maneje ventanas de contexto masivas e interacción en tiempo real sin las penalizaciones de latencia tradicionales asociadas con los sistemas en cascada.
Niveles de modelo
La serie se ofrece en tres tamaños para equilibrar rendimiento y costo:
Además: razonamiento de alta complejidad y máxima precisión. Flash: optimizado para interacción de alto rendimiento y baja latencia. Ligero: una variante más pequeña para tareas centradas en la eficiencia.
La arquitectura del pensador-hablador: un marco unificado de MoE
En el núcleo de Qwen3.5-Omni hay una arquitectura bifurcada pero estrechamente integrada que consta de dos componentes principales: el Pensador y el Hablador.
En iteraciones anteriores, los modelos multimodales a menudo dependían de codificadores externos previamente entrenados (como Whisper para audio). Qwen3.5-Omni va más allá al utilizar un codificador nativo de transformador de audio (AuT). Este codificador fue entrenado previamente con más de 100 millones de horas de datos audiovisuales, lo que proporcionó al modelo una comprensión fundamentada de los matices temporales y acústicos de los que carecen los modelos tradicionales basados en texto.
Mezcla de expertos (MoE) de atención híbrida
Tanto el Pensador como el Hablador aprovechan el MoE de Atención Híbrida. En una configuración MoE estándar, solo se activa un subconjunto de parámetros (los ‘expertos’) para cualquier token determinado, lo que permite un alto recuento total de parámetros con menores costos computacionales activos. Al aplicar esto a un mecanismo de atención híbrida, Qwen3.5-Omni puede sopesar efectivamente la importancia de diferentes modalidades (por ejemplo, centrarse más en tokens visuales durante una tarea de análisis de video) mientras mantiene el rendimiento requerido para los servicios de transmisión.
Esta arquitectura admite una entrada de contexto largo de 256 k, lo que permite que el modelo ingiera y razone:
Más de 10 horas de audio continuo. Más de 400 segundos de contenido audiovisual de 720p (muestreado a 1 FPS).
Rendimiento de evaluación comparativa: el hito del ‘215 SOTA’
Una de las afirmaciones técnicas más destacadas con respecto al modelo insignia Qwen3.5-Omni-Plus es su desempeño en la clasificación mundial. El modelo logró resultados de vanguardia (SOTA) en 215 subtareas de comprensión, razonamiento e interacción de audio y audiovisuales.
Estos 215 triunfos SOTA no son simplemente una medida de evaluación amplia, sino que abarcan puntos de referencia técnicos específicos, que incluyen:
3 puntos de referencia audiovisuales y 5 puntos de referencia de audio generales. 8 puntos de referencia ASR (reconocimiento automático de voz). 156 tareas de traducción de voz a texto (S2TT) específicas del idioma. 43 tareas ASR específicas del idioma.
Según sus informes técnicos oficiales, Qwen3.5-Omni-Plus supera a Gemini 3.1 Pro en comprensión, razonamiento, reconocimiento y traducción de audio general. En comprensión audiovisual, logra la paridad con el buque insignia de Google, al tiempo que mantiene el texto central y el rendimiento visual de la serie estándar Qwen3.5.
Soluciones técnicas para interacción en tiempo real
Construir un modelo que pueda “hablar” y “escuchar” en tiempo real requiere resolver desafíos de ingeniería específicos relacionados con la estabilidad de la transmisión y el flujo conversacional.
ARIA: Alineación de entrelazado de tasa adaptativa
Un modo de falla común en la interacción de voz en streaming es la “inestabilidad del habla”. Debido a que los tokens de texto y los tokens de voz tienen diferentes eficiencias de codificación, un modelo puede leer mal los números o tartamudear al intentar sincronizar su razonamiento de texto con su salida de audio.
Para abordar esto, el equipo de Alibaba Qwen desarrolló ARIA (Adaptive Rate Interleave Alignment). Esta técnica alinea dinámicamente las unidades de texto y voz durante la generación. Al ajustar la velocidad de entrelazado en función de la densidad de la información que se procesa, ARIA mejora la naturalidad y solidez de la síntesis de voz sin aumentar la latencia.
Interrupción semántica y toma de turnos
Para los desarrolladores de IA que crean asistentes de voz, manejar las interrupciones es muy difícil. Qwen3.5-Omni presenta el reconocimiento nativo de la intención de tomar turnos. Esto permite al modelo distinguir entre ‘canalización inversa’ (ruido de fondo sin significado o comentarios del oyente como ‘ajá’) y una interrupción semántica real en la que el usuario intenta tomar la palabra. Esta capacidad está integrada directamente en la API del modelo, lo que permite conversaciones más humanas y full-duplex.
Capacidad emergente: codificación de vibraciones audiovisuales
Quizás la característica más singular identificada durante el escalado multimodal nativo de Qwen3.5-Omni es la codificación de vibración audiovisual. A diferencia de la generación de código tradicional que se basa en indicaciones de texto, Qwen3.5-Omni puede realizar tareas de codificación basadas directamente en instrucciones audiovisuales.
Por ejemplo, un desarrollador podría grabar un vídeo de la interfaz de usuario de un software, describir verbalmente un error mientras señala elementos específicos y el modelo puede generar directamente la solución. Este surgimiento sugiere que el modelo ha desarrollado un mapeo intermodal entre jerarquías visuales de la interfaz de usuario, intención verbal y lógica de código simbólico.
Conclusiones clave
Qwen3.5-Omni utiliza una arquitectura multimodal nativa Thinker-Talker para el procesamiento unificado de texto, audio y video. El modelo admite contexto de 256k, más de 10 horas de audio y más de 400 segundos de video de 720p a 1 FPS. Alibaba informa reconocimiento de voz en 113 idiomas/dialectos y generación de voz en 36 idiomas/dialectos. Las características clave del sistema incluyen interrupción semántica, reconocimiento de intención de turnos, TMRoPE y ARIA para interacción en tiempo real.
Consulte los detalles técnicos, Qwenchat, demostración en línea en HF y demostración sin conexión en HF. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.