Google AI lanza Gemini 3.1 Flash TTS: un nuevo punto de referencia en voz AI expresiva y controlable

Google ha presentado Gemini 3.1 Flash TTS, un modelo de vista previa de texto a voz centrado en mejorar la calidad del habla, el control expresivo y la generación multilingüe. A diferencia de versiones anteriores que priorizaban la conversión simple, esta versión enfatiza las etiquetas de audio en lenguaje natural, el soporte nativo para más de 70 idiomas y el diálogo nativo entre varios hablantes.

Este lanzamiento marca un cambio desde la generación de audio de “caja negra” hacia un flujo de trabajo más granular basado en instrucciones. El modelo se está implementando en versión preliminar a través de Gemini API y Google AI Studio, en Vertex AI para empresas y a través de Google Vids para usuarios de Workspace.

Calidad de voz, control y flujo de trabajo del desarrollador

El logro técnico más destacado de Gemini 3.1 Flash TTS es su desempeño en los puntos de referencia de la industria. Actualmente, el modelo reporta una puntuación Elo de 1211 en la tabla de clasificación TTS de Análisis Artificial, lo que lo posiciona como el modelo de habla más natural y expresivo de Google hasta la fecha.

Más allá de la calidad bruta, la actualización introduce una capa de control más sofisticada para los desarrolladores de IA. En lugar de depender de configuraciones estáticas, los desarrolladores ahora pueden usar etiquetas de audio e indicaciones en lenguaje natural para controlar lo siguiente:

Estilo y tono: indicar al modelo que cambie la entrega según el contexto de la escena. Ritmo y presentación: Dirigir el ritmo y el énfasis del discurso para que coincida con necesidades narrativas específicas. Acento y dialecto: aprovechando los matices localizados dentro de los más de 70 idiomas admitidos.

Diálogo nativo entre varios hablantes

Un diferenciador clave de Gemini 3.1 Flash TTS es su compatibilidad con el diálogo nativo de varios hablantes. Los canales de TTS tradicionales a menudo requieren llamadas API independientes para diferentes voces, lo que puede provocar un ritmo desarticulado. Al manejar a varios hablantes de forma nativa, el modelo mantiene un flujo de conversación más natural, lo que lo hace particularmente útil para los desarrolladores que crean podcasts, guiones dramáticos o interfaces de asistente colaborativo.

Seguridad e identificación: marca de agua SynthID

A medida que el audio generativo alcanza niveles más altos de fidelidad, la capacidad de identificar contenido generado por IA se convierte en una necesidad técnica. Google ha integrado la marca de agua SynthID en todo el audio generado por Gemini 3.1 Flash TTS.

La implementación de SynthID está diseñada con dos prioridades:

Imperceptibilidad: la marca de agua está incrustada de una manera que no degrada la experiencia de audio del oyente. Detección confiable: la marca de agua permite la identificación de contenido generado por IA, lo que ayuda a prevenir la desinformación y garantiza la transparencia en los ecosistemas digitales.

Resumen técnico

CaracterísticaEspecificaciónModeloGemini 3.1 Flash TTS (vista previa)Puntuación Elo1,211 (Tabla de clasificación TTS de análisis artificial)Soporte de idiomasMás de 70 idiomasCaracterísticas principalesEtiquetas de audio, control de lenguaje natural, diálogo entre varios oradoresSeguridadSintetizador integradoMarcas de aguaPlataformasGemini API, AI Studio, Vertex AI, Google Vids

En general, Gemini 3.1 Flash TTS representa un paso hacia un enfoque más “de autor” de la IA de audio. Al combinar un alto rendimiento de referencia con controles granulares de lenguaje natural, el equipo de IA de Google proporciona las herramientas para crear experiencias de voz que se sientan menos como una salida sintetizada y más como interpretaciones dirigidas.

Consulte los detalles técnicos, para desarrolladores en vista previa disponible ahora en Gemini API y Google AI Studio, para empresas en vista previa en Vertex AI y para usuarios de Workspace a través de Google Vids. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.