La interpretación simultánea es uno de los problemas más difíciles de la IA aplicada. Le estás pidiendo a un modelo que traduzca el discurso antes de que el hablante haya terminado una oración. Cada segundo extra de retraso rompe la ilusión de comunicación en tiempo real. El equipo Qwen de Alibaba ha ido mejorando esto con cada lanzamiento. Su último modelo, Qwen3.5-LiveTranslate-Flash, reduce esa latencia a 2,8 segundos y amplía la cobertura del idioma de entrada a 60 idiomas.
Un salto significativo desde la versión anterior
El Qwen3-LiveTranslate-Flash manejó 18 idiomas de entrada con aproximadamente tres segundos de latencia. Qwen3.5-LiveTranslate-Flash lo reduce a 2,8 segundos, amplía la cobertura de entrada a 60 idiomas y agrega salida de voz en 29 idiomas. Esto supone una expansión de más de tres veces en la cobertura de idiomas en el lado de los insumos. Para los desarrolladores que crean productos multilingües, esto reduce la necesidad de cambiar de modelo por idioma en la mayoría de los escenarios empresariales globales.
La mejora de la latencia proviene de una técnica para procesar lo que el equipo llama "unidades de lectura". En lugar de esperar a que llegue una oración completa antes de producir un resultado, el modelo decide cuándo se ha acumulado suficiente significado en un segmento para comprometerse con una traducción. Transmite la salida continuamente mientras el hablante sigue hablando. Esta es la misma lógica subyacente que la predicción de unidades semánticas, pero con una implementación más estricta que elimina esos 200 milisegundos adicionales.
La visión es ahora un insumo de primera clase
La mayoría de los sistemas de traducción tratan el audio como la única señal de entrada. Eso funciona bien en condiciones de estudio limpio. Se estropea en una sala de conferencias abarrotada, en una sala de operaciones ruidosa o en cualquier lugar con voces superpuestas y mala acústica.
Qwen3.5-LiveTranslate-Flash adopta un enfoque diferente. Analiza información visual en paralelo con texto de audio en pantalla, objetos mostrados físicamente, movimientos de labios y gestos. Cuando una palabra es fonéticamente ambigua o el flujo de audio se degrada, el contexto visual llena el vacío y agudiza la decisión de traducción. Esta no es una característica menor. En la implementación del mundo real, la calidad del audio rara vez está garantizada. Tener un canal de visión significa que el modelo maneja la complicada realidad de la interpretación en vivo con más gracia que los sistemas de solo audio.
La clonación de voz ocurre en tiempo real
Esta es la parte que más destaca en la versión Qwen3.5. Los sistemas de traducción estándar reemplazan la voz del hablante por una voz de síntesis genérica. En cambio, Qwen3.5-LiveTranslate-Flash clona las características de voz del hablante original durante la traducción. Una sola frase hablada es suficiente para que el modelo realice esta adaptación acústica.
Para los oyentes del lado receptor, la salida traducida suena como si fuera la misma persona hablando el idioma de destino y no como un sustituto robótico. Esto es importante en la interpretación de conferencias en vivo, transmisiones en vivo multilingües o llamadas de clientes internacionales. La experiencia parece notablemente más humana que la que ofrecen los sistemas actuales.
Configurar palabras clave específicas del dominio
Un modo de falla persistente de los modelos de traducción en entornos profesionales son los nombres propios y el vocabulario especializado. Un modelo que traduce un informe médico puede traducir erróneamente constantemente el nombre de un medicamento. Una sesión de interpretación jurídica se divide en un plazo de estatuto técnico.
Qwen3.5-LiveTranslate-Flash soluciona esto con una configuración dinámica de palabras clave en tiempo de ejecución. Los desarrolladores pueden incorporar un glosario de marcas, términos médicos, terminología legal o vocabulario técnico, y el modelo maneja esos términos de manera mucho más confiable. Esto no está disponible en la mayoría de las API de traducción de uso general y cierra una brecha real para implementaciones empresariales de dominios específicos.
Rendimiento de referencia
En FLEURS y CoVoST2, dos puntos de referencia establecidos para la traducción de voz multilingüe, Qwen3.5-LiveTranslate-Flash supera a las principales alternativas comerciales. FLEURS prueba la calidad de la traducción en una amplia variedad de pares de idiomas en condiciones acústicas reales. CoVoST2 cubre 21 direcciones de traducción del habla, lo que lo convierte en un proxy práctico para el rendimiento del canal multilingüe.
Explicador visual de Marktechpost
1 Descripción general 2 Requisitos previos 3 Conectar 4 Enviar audio 5 Entrada visual 6 Palabras clave 7 Idiomas
que hace
Qwen3.5-LiveTranslate-Flash de un vistazo
Qwen3.5-LiveTranslate-Flash es un modelo de traducción en tiempo real cerrado y solo API del equipo Qwen de Alibaba. Toma fotogramas de audio y vídeo como entradas simultáneas y salidas de texto y voz traducidos. El modelo utiliza un protocolo basado en WebSocket sobre Alibaba Cloud Model Studio.
Estado latente
2,8s
Por token para salida de audio
Idiomas de entrada
60
Habla + entrada visual
Salida de voz
29
Idiomas con voz
Protocolo
WebSocket
Conexión persistente
Comprensión mejorada por la visión: los movimientos de los labios, los gestos y el texto en pantalla influyen en la decisión de traducción junto con el audio.
Clonación de voz en tiempo real: clona el perfil de voz del hablante original en la salida traducida a partir de una sola frase hablada.
Predicción de unidades semánticas: se compromete a generar segmentos antes de que termine una oración completa, lo que permite una transmisión continua sin esperar a que se completen las expresiones.
Configuración dinámica de palabras clave: inserte glosarios específicos del dominio en tiempo de ejecución para terminología técnica, médica o legal
Antes de empezar
Requisitos previos
Necesita una cuenta de Alibaba Cloud con acceso a Model Studio y una clave API de DashScope válida. El modelo está disponible a través del ID del modelo qwen3-livetranslate-flash-realtime.
Crear una cuenta en la nube de Alibaba
Regístrese en alibabacloud.com y active Alibaba Cloud Model Studio en el panel de su cuenta.
Obtenga su clave API de DashScope
Vaya a Model Studio → Claves API. Genere una clave y guárdela como la variable de entorno DASHSCOPE_API_KEY. Nunca lo codifique en archivos fuente.
Instalar la dependencia de Python
Instale el paquete websocket-client para la conexión WebSocket. Para la captura de audio, instale también pyaudio.
Comprueba tu configuración de audio
El modelo acepta audio mono PCM de 16 bits y 16 kHz en la entrada. Confirme que su micrófono o fuente de audio pueda emitir en este formato antes de realizar la conexión.
Copia BASH
# Instalar dependencias pip install websocket-client pyaudio # Establecer su clave API como una variable de entorno export DASHSCOPE_API_KEY = "your_key_here"
Paso 3: Conexión
Establecer la conexión WebSocket
El modelo utiliza el protocolo WebSocket para una conexión bidireccional persistente. Usted se autentica a través de un token de portador en el encabezado de la conexión usando su clave API de DashScope.
Copia de Python
importar json, websocket, sistema operativo API_KEY = sistema operativo. getenv ( "DASHSCOPE_API_KEY" ) API_URL = ( "wss://dashscope-intl.aliyuncs.com" "/api-ws/v1/realtime" "?model=qwen3-livetranslate-flash-realtime" ) def on_open (ws): print ( "Conectado a Qwen3.5-LiveTranslate-Flash" ) def on_message (ws, mensaje): datos = json. cargas (mensaje) print ( "Evento de traducción:" , datos) def on_error (ws, error): print ( "Error:" , error) ws = websocket. WebSocketApp ( API_URL , header=[ "Autorización: Portador " + API_KEY ], on_open= on_open , on_message= on_message , on_error= on_error ) ws. ejecutar_para siempre ()
La conexión permanece abierta durante toda la sesión. No se vuelve a conectar por enunciado. Envíe fragmentos de audio y fotogramas de imágenes de forma continua a través del mismo conector.
Paso 4: transmisión de audio
Configurar y transmitir entrada de audio
Después de conectarse, envíe un evento de configuración de sesión para establecer los idiomas de origen y de destino. Luego, transmita fragmentos de audio PCM de forma continua. El modelo utiliza session.input_audio_transcription.language para identificar el idioma de entrada.
Copia de Python
import base64, pyaudio # Configuración de entrada de audio: 16 kHz, PCM mono de 16 bits INPUT_RATE = 16000 INPUT_CHUNK = 1600 # 100 ms por fragmento INPUT_FORMAT = pyaudio. paInt16 INPUT_CHANNELS = 1 def on_open (ws): # 1. Enviar la configuración de sesión primero session_cfg = { "tipo" : "session.update" , "sesión" : { "input_audio_transcription" : { "idioma" : "zh" # fuente: chino }, "traducción" : { "target_language" : "en" # destino: inglés } } } ws. send (json. dumps (session_cfg)) # 2. Transmitir audio del micrófono pa = pyaudio. PyAudio () flujo = pa. abierto (tasa = INPUT_RATE , canales = INPUT_CHANNELS , formato = INPUT_FORMAT , entrada = True , frames_per_buffer = INPUT_CHUNK ) mientras que True : fragmento = transmisión. leer ( INPUT_CHUNK ) audio_b64 = base64. codificación b64 (fragmento). decodificar () ws. enviar (json. dumps ({ "tipo" : "input_audio_buffer.append" , "audio" : audio_b64 }))
No envíe audio antes de que se reconozca el evento session.update. Espere el evento de confirmación de la sesión del servidor antes de transmitir fragmentos de audio.
Paso 5: entrada de visión
Envíe fotogramas de vídeo para una comprensión mejorada de la visión
Qwen3.5-LiveTranslate-Flash lee movimientos de labios, gestos y texto en pantalla de cuadros de video junto con audio. Envíe fotogramas JPEG codificados en base64 a intervalos regulares durante la sesión. Incluso una velocidad de fotogramas baja mejora significativamente la precisión en condiciones de audio ruidosas.
Copia de Python
importar cv2, base64, subprocesamiento, definición de tiempo stream_video_frames (ws): cap = cv2. VideoCapture ( 0 ) # 0 = cámara predeterminada mientras que True : ret, frame = cap. read () si no ret: break # Codificar fotograma como JPEG → base64 _, buf = cv2. imencode ( ".jpg" , marco) img_b64 = base64. codificación b64 (buf). decodificar () ws. enviar (json. dumps ({ "tipo" : "input_image_buffer.append" , "imagen" : img_b64 })) tiempo. dormir ( 0.5 ) # ~2fps es suficiente # Ejecutar transmisión de video en un subproceso separado . Hilo (destino= stream_video_frames , args=(ws,), daemon= True ). comenzar ()
La entrada de visión es opcional, pero se recomienda para escenarios de habla humana en vivo. Para archivos de audio pregrabados sin transmisión de cámara, puede omitir los fotogramas de imagen por completo y confiar únicamente en el audio.
Paso 6: Precisión del dominio
Configuración dinámica de palabras clave
Para vocabulario técnico, médico, legal o específico de una marca, puede insertar un glosario de palabras clave al inicio de la sesión. El modelo utiliza esta lista para mejorar significativamente la confiabilidad de la traducción de términos que los datos de entrenamiento estándar pueden manejar de manera inconsistente.
Copia de Python
# Agregue a su carga útil session.update session_cfg = { "type" : "session.update" , "session" : { "input_audio_transcription" : { "language" : "zh" }, "translation" : { "target_language" : "en" }, # Inyecte palabras clave de dominio aquí "keywords" : [ { "source" : "达芬奇机器人" , "destino" : "sistema quirúrgico da Vinci" }, { "fuente" : "腹腔镜" , "destino" : "laparoscopio" }, { "fuente" : "实体瘤" , "destino" : "tumor sólido" } ] } } ws. enviar (json. dumps (session_cfg))
Funciona para marcas, nombres de medicamentos, estatutos legales y números de modelos técnicos Las palabras clave se limitan a la sesión y no persisten en todas las conexiones Mantenga la lista enfocada: solo términos cuya mala traducción causaría errores reales
Referencia
Idiomas soportados
Qwen3.5-LiveTranslate-Flash comprende 60 idiomas de entrada y puede producir salida de voz en 29 idiomas. Las píldoras resaltadas a continuación son idiomas de salida de voz confirmados. Todas las píldoras representan entradas admitidas.
Chino
Inglés
Francés
Alemán
Español
japonés
coreano
ruso
portugués
italiano
árabe
hindi
turco
indonesio
tailandés
vietnamita
Griego
mandarín
cantonés
dialecto wu
sichuanés
dialecto de tianjin
dialecto de Beijing
+ 37 más
Las píldoras resaltadas tienen compatibilidad confirmada con salida de voz (audio). Las pastillas simples son de solo entrada o no están confirmadas para la salida de voz. Verifique su par de idiomas de destino específico en la documentación de Alibaba Cloud Model Studio antes de crear canales de salida de audio.
El modelo admite salida de texto para los 60 idiomas de entrada. La salida de voz está disponible solo para 29 idiomas. Si su canal requiere entrega de audio y su idioma de destino no está en la lista confirmada, planifique un paso TTS alternativo.
Conclusiones clave
Qwen3.5-LiveTranslate-Flash ofrece interpretación multimodal en tiempo real en 60 idiomas de entrada y 29 idiomas de salida de voz con 2,8 segundos de latencia. El modelo utiliza comprensión mejorada por visión (lectura de movimientos de labios, gestos y texto en pantalla) para mantener la precisión en entornos de audio ruidosos o degradados. La clonación de voz en tiempo real replica el perfil de voz del hablante original en la salida traducida utilizando una sola frase hablada. La predicción de unidades semánticas mediante el procesamiento de “unidades de lectura” permite una salida de transmisión continua sin esperar oraciones completas, lo que reduce la latencia a 2,8 segundos. La configuración dinámica de palabras clave permite a los desarrolladores insertar glosarios específicos de dominio en tiempo de ejecución, lo que mejora la confiabilidad de la traducción de terminología técnica, médica y legal.
Consulta los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros