Google lanza Gemini 3.8 Flash TTS y Flash-Lite TTS con diseño de voz basado en indicaciones

Google ha lanzado Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, 2 nuevos modelos de conversión de texto a voz en su familia Gemini Audio. Google los llama sus modelos de generación de audio más expresivos hasta el momento. Flash TTS se centra en la dirección creativa y las voces de los personajes. Flash-Lite TTS apunta a una producción rentable y de gran volumen. Ambos permiten a los desarrolladores dirigir la entrega línea por línea utilizando lenguaje natural.

¿Es desplegable? Sí, ambos modelos se están implementando ahora a través de la API Gemini y Google AI Studio. El acceso es solo API, sin pesos abiertos para el autohospedaje. El acceso a la API empresarial a través de Gemini Enterprise figura como próximamente.

Lo que envió Google

El lanzamiento divide TTS en 2 niveles con controles de dirección compartidos:

Gemini 3.8 Flash TTS está diseñado para una dirección creativa profunda y diseño de personajes. Los usos objetivo incluyen juegos, audiolibros inmersivos, podcasts y medios interactivos. Ofrece control granular sobre las señales de actuación, el ritmo, los cambios de dialecto y la canalización inversa. Gemini 3.8 Flash-Lite TTS está diseñado para una escala rentable y de gran volumen. Google lo posiciona para doblaje, creación de contenidos de audio y agentes de voz expresivos. Ofrece un control detallado sobre el tono, el ritmo y los matices expresivos.

En AI Studio, los enlaces del área de juegos utilizan los identificadores de modelo gemini-3.8-flash-tts y gemini-3.8-flash-lite-tts.

Diseño de voz a partir de un mensaje de texto

El anterior Gemini TTS ofrecía 30 voces originales. La versión 3.8 pasa a un sistema de voz mucho más grande.

Diseño de voz generativa: Flash TTS crea nuevas voces a partir de indicaciones que describen roles, acentos y características de la voz. Esto funciona en más de 100 idiomas y dialectos. Las demostraciones de Google incluyen un DJ de Melbourne, un robot monótono y un dragón japonés. Biblioteca de voces: los desarrolladores obtienen más de 2000 voces listas para producción. La cobertura incluye variedades regionales como el español mexicano, el francés de Quebec y el inglés escocés. Guardar y escalar: las voces personalizadas se pueden guardar y reutilizar, con una variación mínima entre proyectos. Remezcla de voz (próximamente): los usuarios ajustarán el timbre, el tono, el ritmo y el acento de una voz de la biblioteca mediante indicaciones.

Dirigir la actuación

Ambos modelos aceptan acotaciones escénicas escritas en el guión. Géminis también puede dirigir la entrega a partir de señales naturales del guión.

Generación de formato largo: la calidad de la voz, el ritmo y el timbre se mantienen durante horas de audio continuo. Puesta en escena nativa de 2 hablantes: un único guión impulsa una conversación de varios turnos con voces distintas y separadas. Estallidos vocales: señales no verbales como y añaden textura conversacional. Backchanneling: interjecciones de escucha activa como |mhm| y |sí| controlar los ritmos de reacción y el ritmo de la comedia.

Controles de seguridad y replicación de voz

La replicación de voz crea un perfil vocal consistente a partir de una muestra de audio de 30 segundos. La muestra debe ser tu voz o una que tengas derecho a usar. La replicación requiere una grabación de consentimiento verbal del propietario de la voz, comparada con el hablante de referencia.

Cada clip de los modelos Gemini Audio lleva una marca de agua SynthID. Esta marca imperceptible está incrustada directamente en la salida de audio. Las voces replicadas también llevan credenciales de contenido C2PA. Google señala la tarjeta modelo Gemini 3.8 Audio por su enfoque de seguridad más amplio.

Resultados de referencia

Google informa estos resultados para los nuevos modelos:

Punto de referencia de diseño de voz de Hume AI: Flash TTS ocupa el puesto número 1 en general con una puntuación de 71,4, según Hume AI. Modelado de acento: Flash TTS lidera con una puntuación de 60,8. Índice de calidad general de Hume AI: Flash TTS ocupa el puesto número 1 y Flash-Lite TTS ocupa el puesto número 2. Preferencia ciega de Voice Arena: Ambos modelos ocupan las primeras posiciones en japonés, portugués brasileño, vietnamita, árabe estándar moderno, español mexicano e hindi.

Conclusiones clave

Google lanzó Gemini 3.8 Flash TTS para trabajo creativo y Flash-Lite TTS para escalar. Flash TTS diseña nuevas voces a partir de indicaciones en más de 100 idiomas y dialectos. Los desarrolladores obtienen más de 2000 voces de producción, en comparación con 30 originales. La replicación de voz necesita una muestra de 30 segundos más una grabación de consentimiento coincidente. Flash TTS ocupa el puesto número 1 en el benchmark de diseño de voz de Hume AI con 71,4.

Preguntas frecuentes

¿Qué es Gemini 3.8 Flash TTS? Es el modelo de conversión de texto a voz de Google para el diseño de voz creativo y la dirección de interpretación línea por línea. Está disponible a través de Gemini API y Google AI Studio. ¿En qué se diferencia Flash-Lite TTS? Flash-Lite TTS está optimizado para cargas de trabajo rentables y de gran volumen, como doblaje y agentes de voz. Ocupa el puesto número 2 en el índice de calidad general de Hume AI. ¿Puedo clonar mi propia voz? Sí, con una muestra de 30 segundos y una grabación de consentimiento verbal. No está disponible en AI Studio en varias regiones, incluidos el Reino Unido, el EEE y la India.

Consulte el blog técnico. Todo el crédito es para el investigador de este proyecto. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150kML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Asif Razzaq es el director ejecutivo de Marktechpost AI Media Inc.. Como emprendedor e ingeniero visionario, Asif está comprometido a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, Marktechpost, que se destaca por su cobertura en profundidad del aprendizaje automático y las noticias sobre aprendizaje profundo que es técnicamente sólida y fácilmente comprensible para una amplia audiencia. La plataforma cuenta con más de 2 millones de visitas mensuales, lo que ilustra su popularidad entre el público.