Google acaba de anunciar Gemini 3.5 Live Translate. Es su último modelo de audio para traducción de voz a voz en vivo. Habla a voz significa que entra audio hablado y sale audio hablado traducido. El modelo detecta más de 70 idiomas automáticamente y genera voz traducida. Preserva la entonación, el ritmo y el tono del hablante en la salida. Los sistemas paso a paso esperan a que termine un orador antes de responder. Gemini 3.5 Live Translate genera voz continuamente. Equilibra el equilibrio entre esperar el contexto y traducir inmediatamente. Más contexto mejora la calidad. La salida más rápida mantiene la traducción sincronizada con el hablante. El resultado permanece unos segundos por detrás del hablante durante toda la sesión.
Géminis 3.5 Traductor en vivo
Gemini 3.5 Live Translate es un modelo de audio único (gemini-3.5-live-translate-preview), no un asistente de chat. Procesa el habla a medida que llega el audio, en lugar de después de una frase completa. Maneja entradas multilingües sin configurar los ajustes manualmente. Su resistencia al ruido permite que las aplicaciones se ejecuten en entornos ruidosos e impredecibles.
El modelo se despliega en tres superficies. Los desarrolladores lo obtienen en vista previa pública a través de Gemini Live API y Google AI Studio. Las empresas obtienen una vista previa privada en Google Meet a partir de este mes. Todos los demás lo obtienen a través de la aplicación Google Translate en Android e iOS.
Cómo funciona la transmisión continua
La diferencia de diseño es importante para crear funciones en tiempo real. Un agente conversacional de Live utiliza interacciones por turnos. Se basa en pausas, detección de intenciones y manejo de interrupciones. Live Translation utiliza en su lugar un procesamiento de flujo continuo. Se traduce mientras el orador habla, sin esperar a que terminen los turnos.
Para mantener umbrales estrictos de latencia en tiempo real, la ruta de traducción solo acepta entrada de audio. La entrada de texto no es compatible con el modo de traducción. El modelo también elimina el uso de herramientas y las instrucciones del sistema en este modo. Eso lo mantiene como un traductor enfocado en lugar de un agente general.
Construyendo con la API en vivo
Los desarrolladores configuran la traducción dentro de la configuración de la sesión de Live API. Estableces un bloque de traducciónConfig dentro del archivo generateConfig. El campo targetLanguageCode toma un código BCP-47, como “pl” o “es”. BCP-47 es el formato estándar para etiquetas de idiomas como en o pt-BR. El valor predeterminado es “en”. El booleano echoTargetLanguage controla la entrada que ya está en el idioma de destino. Cuando es cierto, el modelo se hace eco de ese discurso. Cuando es falso, permanece en silencio. También puede habilitar inputAudioTranscription y outputAudioTranscription para transcripciones de texto.
Los formatos de audio son fijos. La entrada es PCM sin formato de 16 bits a 16 kHz, mono, little-endian. La salida es PCM sin formato de 16 bits a 24 kHz, mono, little-endian. PCM es audio sin comprimir. Envías audio en fragmentos de 100 ms. Para las aplicaciones del lado del cliente, los tokens efímeros en el punto final v1alpha evitan exponer su clave API.
Caso de uso
El modelo apunta a la interpretación en vivo en varios entornos. Google enumera llamadas, reuniones, lecciones y transmisiones multilingües. Las plataformas de desarrollo reducen el trabajo de integración de los medios en tiempo real. Agora, Fishjam, LiveKit, Pipecat y Vision Agents ya utilizan Live API. Estas plataformas manejan la compleja infraestructura de transmisión de medios en tiempo real. Eso permite a los desarrolladores centrarse en la experiencia del usuario.
La aplicación de ejemplo de Google demuestra el doblaje y la traducción simultánea en varios idiomas. Grab está probando el modelo para la comunicación entre conductor y viajero en las camionetas. Los usuarios de Grab realizan más de 10 millones de llamadas de voz al mes. CJ ENM, LiveKit y otros informaron comentarios positivos sobre la calidad, precisión y baja latencia.
Cómo cambia Google Meet y Translate
Según el comunicado oficial de Google, Google Meet pronto utilizará 3.5 Live Translate para la traducción de voz. La tabla muestra el antes y el después indicados para Meet.
La actualización de Meet se encuentra en versión preliminar privada para clientes empresariales seleccionados de Workspace este mes. A finales de este año se realizará un lanzamiento más amplio. En la aplicación Traducir, la función de traducción en vivo funciona con cualquier auricular conectado. Refleja el tono del hablante en más de 70 idiomas. Android también gana un modo de escucha. Mantienes el teléfono cerca de tu oreja como si fuera una llamada normal. El audio traducido luego se transmite a través del auricular, sin que otros lo escuchen.
Conclusiones clave
Gemini 3.5 Live Translate es el último modelo de audio de Google para traducción de voz a voz en vivo en más de 70 idiomas. Se transmite continuamente en lugar de paso a paso, permaneciendo unos segundos detrás del altavoz. Los desarrolladores pueden configurarlo a través de Live API usando targetLanguageCode y echoTargetLanguage; Solo audio, entrada de 16 kHz, salida de 24 kHz. Se implementa en Gemini Live API, Google Meet (más de 5 → 70 idiomas) y la aplicación Traductor. Todo el audio generado lleva una marca de agua SynthID imperceptible para su detectabilidad.
Consulta la Ficha Modelo y los detalles técnicos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros