Kyutai, un laboratorio de investigación de IA abierto, ha lanzado un modelo innovador de transmisión de texto a voz (TTS) con ~ 2 mil millones de parámetros. Diseñado para la capacidad de respuesta en tiempo real, este modelo ofrece una generación de audio de latencia ultra baja (220 milisegundos) mientras mantiene una alta fidelidad. Está capacitado en 2.5 millones de horas de audio sin precedentes y tiene licencia bajo el permisivo CC-by-4.0, reforzando el compromiso de Kyutai con la apertura y la reproducibilidad. Este avance redefine la eficiencia y la accesibilidad de los modelos de generación de voz a gran escala, particularmente para la implementación de bordes y la IA agente.
Desempacar el rendimiento: latencia de sub-350 ms para 32 usuarios concurrentes en una sola GPU L40
La capacidad de transmisión del modelo es su característica más distintiva. En una sola GPU NVIDIA L40, el sistema puede servir hasta 32 usuarios concurrentes mientras mantiene la latencia por debajo de los 350 ms. Para uso individual, el modelo mantiene una latencia de generación tan baja como 220 ms, lo que permite aplicaciones casi en tiempo real como agentes de conversación, asistentes de voz y sistemas de narración en vivo. Este rendimiento se habilita a través del nuevo enfoque de modelado de transmisiones retrasadas de Kyutai, que permite que el modelo genere el habla de forma incremental a medida que llega el texto.
Métricas técnicas clave:
- Tamaño del modelo: ~ Parámetros 2b
- Datos de capacitación: 2.5 millones de horas de habla
- Estado latente: 220ms de un solo usuario, <350 ms con 32 usuarios en una GPU L40
- Soporte lingüístico: Inglés y francés
- Licencia: Cc-by-4.0 (código abierto)
Modelado de transmisiones retrasadas: arquitectura de capacidad de respuesta en tiempo real
La innovación de Kyutai está anclada en el modelado de transmisiones retrasadas, una técnica que permite que la síntesis del habla comience antes de que esté disponible el texto de entrada completa. Este enfoque está diseñado específicamente para equilibrar la calidad de la predicción con la velocidad de respuesta, lo que permite TTS de transmisión de alto rendimiento. A diferencia de los modelos autorregresivos convencionales que sufren un retraso de respuesta, esta arquitectura mantiene la coherencia temporal al tiempo que alcanza la síntesis de tiempo más rápido que real.
La receta de la base de código y la capacitación para esta arquitectura están disponibles en Kyutai’s Repositorio de Githubapoyando la reproducibilidad total y las contribuciones comunitarias.
Disponibilidad del modelo y compromiso de investigación abierta
Kyutai ha lanzado los scripts de pesas e inferencias de modelos en Cara abrazadahaciéndolo accesible para investigadores, desarrolladores y equipos comerciales. La licencia permisiva de CC-by-4.0 fomenta la adaptación e integración sin restricciones en las aplicaciones, siempre que se mantenga la atribución adecuada.
Este lanzamiento admite la inferencia de lotes y transmisión, por lo que es una base versátil para la clonación de voz, chatbots en tiempo real, herramientas de accesibilidad y más. Con modelos previos a la petróleo tanto en inglés como en francés, Kyutai prepara el escenario para las tuberías multilingües de TTS.
Implicaciones para aplicaciones de IA en tiempo real
Al reducir la latencia de la generación de discursos al rango de 200 ms, el modelo de Kyutai reduce el retraso de la intención y el habla humana, lo que lo hace viable para:
- IA conversacional: Interfaces de voz de tipo humano con bajo cambio
- Tecnología de asistencia: Lectores de pantalla más rápidos y sistemas de retroalimentación de voz
- Producción de medios: Offes de voz en off con ciclos de iteración rápidos
- Dispositivos de borde: Inferencia optimizada para entornos de baja potencia o en disposición
La capacidad de servir a 32 usuarios en una sola GPU L40 sin degradación de calidad también lo hace atractivo para escalar los servicios de voz de manera eficiente en entornos en la nube.
Conclusión: Abierto, rápido y listo para la implementación
El lanzamiento de la transmisión de TTS de Kyutai es un hito en el discurso ai. Con síntesis de alta calidad, latencia en tiempo real y licencias generosas, aborda las necesidades críticas tanto para los investigadores como para los equipos de productos del mundo real. La reproducibilidad del modelo, el soporte multilingüe y el rendimiento escalable lo convierten en una alternativa destacada a las soluciones propietarias.
Para más detalles, puede explorar la tarjeta modelo oficial en Cara abrazadaexplicación técnica en Sitio de Kyutaiy detalles de implementación en Github.
Sana Hassan, una pasante de consultoría en MarktechPost y estudiante de doble grado en IIT Madras, le apasiona aplicar tecnología e IA para abordar los desafíos del mundo real. Con un gran interés en resolver problemas prácticos, aporta una nueva perspectiva a la intersección de la IA y las soluciones de la vida real.