Nuestras tecnologías pioneras de generación de voz están ayudando a personas de todo el mundo a interactuar con asistentes digitales y herramientas de inteligencia artificial más naturales, conversacionales e intuitivos.
El habla es fundamental para la conexión humana. Ayuda a personas de todo el mundo a intercambiar información e ideas, expresar emociones y crear un entendimiento mutuo. A medida que nuestra tecnología diseñada para generar voces naturales y dinámicas continúa mejorando, estamos desbloqueando experiencias digitales más ricas y atractivas.
En los últimos años, hemos estado ampliando las fronteras de la generación de audio, desarrollando modelos que pueden crear voz natural y de alta calidad a partir de una variedad de entradas, como texto, controles de tempo y voces particulares. Esta tecnología impulsa el audio de un solo altavoz en muchos productos y experimentos de Google, incluidos Gemini Live, Project Astra, Journey Voices y el doblaje automático de YouTube, y está ayudando a personas de todo el mundo a interactuar con asistentes digitales y herramientas de inteligencia artificial más naturales, conversacionales e intuitivos.
Trabajando junto con socios de Google, recientemente ayudamos a desarrollar dos nuevas funciones que pueden generar diálogos extensos con varios oradores para hacer que el contenido complejo sea más accesible:
NotebookLM Audio Overviews convierte los documentos cargados en un diálogo atractivo y animado. Con un solo clic, dos anfitriones de IA resumen el material del usuario, hacen conexiones entre temas y bromean de un lado a otro. Illuminate crea debates formales generados por IA sobre trabajos de investigación para ayudar a que el conocimiento sea más accesible y digerible.
Aquí, proporcionamos una descripción general de nuestra última investigación sobre generación de voz que respalda todos estos productos y herramientas experimentales.
Técnicas pioneras para la generación de audio
Durante años, hemos estado invirtiendo en investigación de generación de audio y explorando nuevas formas de generar un diálogo más natural en nuestros productos y herramientas experimentales. En nuestra investigación anterior sobre SoundStorm, demostramos por primera vez la capacidad de generar segmentos de diálogo natural de 30 segundos entre varios hablantes.
Esto amplió nuestro trabajo anterior, SoundStream y AudioLM, lo que nos permitió aplicar muchas técnicas de modelado de lenguaje basado en texto al problema de la generación de audio.
SoundStream es un códec de audio neuronal que comprime y descomprime eficientemente una entrada de audio, sin comprometer su calidad. Como parte del proceso de capacitación, SoundStream aprende a asignar audio a una variedad de tokens acústicos. Estos tokens capturan toda la información necesaria para reconstruir el audio con alta fidelidad, incluidas propiedades como la prosodia y el timbre.
AudioLM trata la generación de audio como una tarea de modelado de lenguaje para producir tokens acústicos de códecs como SoundStream. Como resultado, el marco AudioLM no hace suposiciones sobre el tipo o la composición del audio que se genera y puede manejar de manera flexible una variedad de sonidos sin necesidad de ajustes arquitectónicos, lo que lo convierte en un buen candidato para modelar diálogos de varios hablantes.