El equipo Qwen de Alibaba presenta Qwen3.5-LiveTranslate-Flash: interpretación multimodal en tiempo real en 60 idiomas con una latencia de 2,8 segundos

La interpretación simultánea es uno de los problemas más difíciles de la IA aplicada. Le estás pidiendo a un modelo que traduzca el discurso antes de que el hablante haya terminado una oración. Cada segundo extra de retraso rompe la ilusión de comunicación en tiempo real. El equipo Qwen de Alibaba ha ido mejorando esto con cada lanzamiento. Su último modelo, Qwen3.5-LiveTranslate-Flash, reduce esa latencia a 2,8 segundos y amplía la cobertura del idioma de entrada a 60 idiomas.

https://qwen.ai/blog?id=qwen3.5-livetranslate

Un salto significativo desde la versión anterior

El Qwen3-LiveTranslate-Flash manejó 18 idiomas de entrada con aproximadamente tres segundos de latencia. Qwen3.5-LiveTranslate-Flash lo reduce a 2,8 segundos, amplía la cobertura de entrada a 60 idiomas y agrega salida de voz en 29 idiomas. Esto supone una expansión de más de tres veces en la cobertura de idiomas en el lado de los insumos. Para los desarrolladores que crean productos multilingües, esto reduce la necesidad de cambiar de modelo por idioma en la mayoría de los escenarios empresariales globales.

La mejora de la latencia proviene de una técnica para procesar lo que el equipo llama "unidades de lectura". En lugar de esperar a que llegue una oración completa antes de producir un resultado, el modelo decide cuándo se ha acumulado suficiente significado en un segmento para comprometerse con una traducción. Transmite la salida continuamente mientras el hablante sigue hablando. Esta es la misma lógica subyacente que la predicción de unidades semánticas, pero con una implementación más estricta que elimina esos 200 milisegundos adicionales.

La visión es ahora un insumo de primera clase

La mayoría de los sistemas de traducción tratan el audio como la única señal de entrada. Eso funciona bien en condiciones de estudio limpio. Se estropea en una sala de conferencias abarrotada, en una sala de operaciones ruidosa o en cualquier lugar con voces superpuestas y mala acústica.

Qwen3.5-LiveTranslate-Flash adopta un enfoque diferente. Analiza información visual en paralelo con texto de audio en pantalla, objetos mostrados físicamente, movimientos de labios y gestos. Cuando una palabra es fonéticamente ambigua o el flujo de audio se degrada, el contexto visual llena el vacío y agudiza la decisión de traducción. Esta no es una característica menor. En la implementación del mundo real, la calidad del audio rara vez está garantizada. Tener un canal de visión significa que el modelo maneja la complicada realidad de la interpretación en vivo con más gracia que los sistemas de solo audio.

La clonación de voz ocurre en tiempo real

Esta es la parte que más destaca en la versión Qwen3.5. Los sistemas de traducción estándar reemplazan la voz del hablante por una voz de síntesis genérica. En cambio, Qwen3.5-LiveTranslate-Flash clona las características de voz del hablante original durante la traducción. Una sola frase hablada es suficiente para que el modelo realice esta adaptación acústica.

Para los oyentes del lado receptor, la salida traducida suena como si fuera la misma persona hablando el idioma de destino y no como un sustituto robótico. Esto es importante en la interpretación de conferencias en vivo, transmisiones en vivo multilingües o llamadas de clientes internacionales. La experiencia parece notablemente más humana que la que ofrecen los sistemas actuales.

Configurar palabras clave específicas del dominio

Un modo de falla persistente de los modelos de traducción en entornos profesionales son los nombres propios y el vocabulario especializado. Un modelo que traduce un informe médico puede traducir erróneamente constantemente el nombre de un medicamento. Una sesión de interpretación jurídica se divide en un plazo de estatuto técnico.

Qwen3.5-LiveTranslate-Flash soluciona esto con una configuración dinámica de palabras clave en tiempo de ejecución. Los desarrolladores pueden incorporar un glosario de marcas, términos médicos, terminología legal o vocabulario técnico, y el modelo maneja esos términos de manera mucho más confiable. Esto no está disponible en la mayoría de las API de traducción de uso general y cierra una brecha real para implementaciones empresariales de dominios específicos.

Rendimiento de referencia

En FLEURS y CoVoST2, dos puntos de referencia establecidos para la traducción de voz multilingüe, Qwen3.5-LiveTranslate-Flash supera a las principales alternativas comerciales. FLEURS prueba la calidad de la traducción en una amplia variedad de pares de idiomas en condiciones acústicas reales. CoVoST2 cubre 21 direcciones de traducción del habla, lo que lo convierte en un proxy práctico para el rendimiento del canal multilingüe.

Explicador visual de Marktechpost

1 Descripción general 2 Requisitos previos 3 Conectar 4 Enviar audio 5 Entrada visual 6 Palabras clave 7 Idiomas

que hace

Qwen3.5-LiveTranslate-Flash de un vistazo

Qwen3.5-LiveTranslate-Flash es un modelo de traducción en tiempo real cerrado y solo API del equipo Qwen de Alibaba. Toma fotogramas de audio y vídeo como entradas simultáneas y salidas de texto y voz traducidos. El modelo utiliza un protocolo basado en WebSocket sobre Alibaba Cloud Model Studio.

Estado latente

2,8s

Por token para salida de audio

Idiomas de entrada

60

Habla + entrada visual

Salida de voz

29

Idiomas con voz

Protocolo

WebSocket

Conexión persistente

✓

Comprensión mejorada por la visión: los movimientos de los labios, los gestos y el texto en pantalla influyen en la decisión de traducción junto con el audio.

◆

Clonación de voz en tiempo real: clona el perfil de voz del hablante original en la salida traducida a partir de una sola frase hablada.

◆

Predicción de unidades semánticas: se compromete a generar segmentos antes de que termine una oración completa, lo que permite una transmisión continua sin esperar a que se completen las expresiones.

◆

Configuración dinámica de palabras clave: inserte glosarios específicos del dominio en tiempo de ejecución para terminología técnica, médica o legal

Antes de empezar

Requisitos previos

Necesita una cuenta de Alibaba Cloud con acceso a Model Studio y una clave API de DashScope válida. El modelo está disponible a través del ID del modelo qwen3-livetranslate-flash-realtime.

Crear una cuenta en la nube de Alibaba

Regístrese en alibabacloud.com y active Alibaba Cloud Model Studio en el panel de su cuenta.

Obtenga su clave API de DashScope

Vaya a Model Studio → Claves API. Genere una clave y guárdela como la variable de entorno DASHSCOPE_API_KEY. Nunca lo codifique en archivos fuente.

Instalar la dependencia de Python

Instale el paquete websocket-client para la conexión WebSocket. Para la captura de audio, instale también pyaudio.

Comprueba tu configuración de audio

El modelo acepta audio mono PCM de 16 bits y 16 kHz en la entrada. Confirme que su micrófono o fuente de audio pueda emitir en este formato antes de realizar la conexión.

Copia BASH

# Instalar dependencias pip install websocket-client pyaudio # Establecer su clave API como una variable de entorno export DASHSCOPE_API_KEY = "your_key_here"

Paso 3: Conexión

Establecer la conexión WebSocket

El modelo utiliza el protocolo WebSocket para una conexión bidireccional persistente. Usted se autentica a través de un token de portador en el encabezado de la conexión usando su clave API de DashScope.

Copia de Python

importar json, websocket, sistema operativo API_KEY = sistema operativo. getenv ( "DASHSCOPE_API_KEY" ) API_URL = ( "wss://dashscope-intl.aliyuncs.com" "/api-ws/v1/realtime" "?model=qwen3-livetranslate-flash-realtime" ) def on_open (ws): print ( "Conectado a Qwen3.5-LiveTranslate-Flash" ) def on_message (ws, mensaje): datos = json. cargas (mensaje) print ( "Evento de traducción:" , datos) def on_error (ws, error): print ( "Error:" , error) ws = websocket. WebSocketApp ( API_URL , header=[ "Autorización: Portador " + API_KEY ], on_open= on_open , on_message= on_message , on_error= on_error ) ws. ejecutar_para siempre ()

ⓘ

La conexión permanece abierta durante toda la sesión. No se vuelve a conectar por enunciado. Envíe fragmentos de audio y fotogramas de imágenes de forma continua a través del mismo conector.

Paso 4: transmisión de audio

Configurar y transmitir entrada de audio

Después de conectarse, envíe un evento de configuración de sesión para establecer los idiomas de origen y de destino. Luego, transmita fragmentos de audio PCM de forma continua. El modelo utiliza session.input_audio_transcription.language para identificar el idioma de entrada.

Copia de Python

import base64, pyaudio # Configuración de entrada de audio: 16 kHz, PCM mono de 16 bits INPUT_RATE = 16000 INPUT_CHUNK = 1600 # 100 ms por fragmento INPUT_FORMAT = pyaudio. paInt16 INPUT_CHANNELS = 1 def on_open (ws): # 1. Enviar la configuración de sesión primero session_cfg = { "tipo" : "session.update" , "sesión" : { "input_audio_transcription" : { "idioma" : "zh" # fuente: chino }, "traducción" : { "target_language" : "en" # destino: inglés } } } ws. send (json. dumps (session_cfg)) # 2. Transmitir audio del micrófono pa = pyaudio. PyAudio () flujo = pa. abierto (tasa = INPUT_RATE , canales = INPUT_CHANNELS , formato = INPUT_FORMAT , entrada = True , frames_per_buffer = INPUT_CHUNK ) mientras que True : fragmento = transmisión. leer ( INPUT_CHUNK ) audio_b64 = base64. codificación b64 (fragmento). decodificar () ws. enviar (json. dumps ({ "tipo" : "input_audio_buffer.append" , "audio" : audio_b64 }))

⚠

No envíe audio antes de que se reconozca el evento session.update. Espere el evento de confirmación de la sesión del servidor antes de transmitir fragmentos de audio.

Paso 5: entrada de visión

Envíe fotogramas de vídeo para una comprensión mejorada de la visión

Qwen3.5-LiveTranslate-Flash lee movimientos de labios, gestos y texto en pantalla de cuadros de video junto con audio. Envíe fotogramas JPEG codificados en base64 a intervalos regulares durante la sesión. Incluso una velocidad de fotogramas baja mejora significativamente la precisión en condiciones de audio ruidosas.

Copia de Python

importar cv2, base64, subprocesamiento, definición de tiempo stream_video_frames (ws): cap = cv2. VideoCapture ( 0 ) # 0 = cámara predeterminada mientras que True : ret, frame = cap. read () si no ret: break # Codificar fotograma como JPEG → base64 _, buf = cv2. imencode ( ".jpg" , marco) img_b64 = base64. codificación b64 (buf). decodificar () ws. enviar (json. dumps ({ "tipo" : "input_image_buffer.append" , "imagen" : img_b64 })) tiempo. dormir ( 0.5 ) # ~2fps es suficiente # Ejecutar transmisión de video en un subproceso separado . Hilo (destino= stream_video_frames , args=(ws,), daemon= True ). comenzar ()

ⓘ

La entrada de visión es opcional, pero se recomienda para escenarios de habla humana en vivo. Para archivos de audio pregrabados sin transmisión de cámara, puede omitir los fotogramas de imagen por completo y confiar únicamente en el audio.

Paso 6: Precisión del dominio

Configuración dinámica de palabras clave

Para vocabulario técnico, médico, legal o específico de una marca, puede insertar un glosario de palabras clave al inicio de la sesión. El modelo utiliza esta lista para mejorar significativamente la confiabilidad de la traducción de términos que los datos de entrenamiento estándar pueden manejar de manera inconsistente.

Copia de Python

# Agregue a su carga útil session.update session_cfg = { "type" : "session.update" , "session" : { "input_audio_transcription" : { "language" : "zh" }, "translation" : { "target_language" : "en" }, # Inyecte palabras clave de dominio aquí "keywords" : [ { "source" : "达芬奇机器人" , "destino" : "sistema quirúrgico da Vinci" }, { "fuente" : "腹腔镜" , "destino" : "laparoscopio" }, { "fuente" : "实体瘤" , "destino" : "tumor sólido" } ] } } ws. enviar (json. dumps (session_cfg))

✓ Funciona para marcas, nombres de medicamentos, estatutos legales y números de modelos técnicos ✓ Las palabras clave se limitan a la sesión y no persisten en todas las conexiones ◆ Mantenga la lista enfocada: solo términos cuya mala traducción causaría errores reales

Referencia

Idiomas soportados

Qwen3.5-LiveTranslate-Flash comprende 60 idiomas de entrada y puede producir salida de voz en 29 idiomas. Las píldoras resaltadas a continuación son idiomas de salida de voz confirmados. Todas las píldoras representan entradas admitidas.

Chino

Inglés

Francés

Alemán

Español

japonés

coreano

ruso

portugués

italiano

árabe

hindi

turco

indonesio

tailandés

vietnamita

Griego

mandarín

cantonés

dialecto wu

sichuanés

dialecto de tianjin

dialecto de Beijing

+ 37 más

ⓘ

Las píldoras resaltadas tienen compatibilidad confirmada con salida de voz (audio). Las pastillas simples son de solo entrada o no están confirmadas para la salida de voz. Verifique su par de idiomas de destino específico en la documentación de Alibaba Cloud Model Studio antes de crear canales de salida de audio.

⚠

El modelo admite salida de texto para los 60 idiomas de entrada. La salida de voz está disponible solo para 29 idiomas. Si su canal requiere entrega de audio y su idioma de destino no está en la lista confirmada, planifique un paso TTS alternativo.

Conclusiones clave

Qwen3.5-LiveTranslate-Flash ofrece interpretación multimodal en tiempo real en 60 idiomas de entrada y 29 idiomas de salida de voz con 2,8 segundos de latencia. El modelo utiliza comprensión mejorada por visión (lectura de movimientos de labios, gestos y texto en pantalla) para mantener la precisión en entornos de audio ruidosos o degradados. La clonación de voz en tiempo real replica el perfil de voz del hablante original en la salida traducida utilizando una sola frase hablada. La predicción de unidades semánticas mediante el procesamiento de “unidades de lectura” permite una salida de transmisión continua sin esperar oraciones completas, lo que reduce la latencia a 2,8 segundos. La configuración dinámica de palabras clave permite a los desarrolladores insertar glosarios específicos de dominio en tiempo de ejecución, lo que mejora la confiabilidad de la traducción de terminología técnica, médica y legal.

Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros