El panorama de Text-to-Speech (TTS) se está alejando de los canales modulares hacia modelos de audio grandes (LAM) integrados. El lanzamiento de Fish Audio de S2-Pro, el modelo insignia dentro del ecosistema Fish Speech, representa un cambio hacia arquitecturas abiertas capaces de realizar síntesis de alta fidelidad para múltiples altavoces con una latencia inferior a 150 ms. El lanzamiento proporciona un marco para la clonación de voz cero y el control emocional granular utilizando un enfoque dual-auto-regresivo (AR).
Arquitectura: el marco Dual-AR y RVQ
La distinción técnica fundamental de Fish Audio S2-Pro es su arquitectura jerárquica Dual-AR. Los modelos TTS tradicionales a menudo luchan con el equilibrio entre la duración de la secuencia y el detalle acústico. S2-Pro aborda esto dividiendo el proceso de generación en dos etapas especializadas: un modelo ‘AR lento’ y un modelo ‘AR rápido’.
El modelo AR lento (parámetros 4B): este componente opera en el eje del tiempo. Es responsable de procesar entradas lingüísticas y generar tokens semánticos. Al utilizar un recuento de parámetros mayor (aproximadamente 4 mil millones), el modelo Slow AR captura las dependencias de largo alcance, la prosodia y los matices estructurales del habla. El modelo Fast AR (parámetros 400M): este componente procesa la dimensión acústica. Predice los libros de códigos residuales para cada token semántico. Este modelo más pequeño y más rápido garantiza que los detalles de alta frecuencia del audio (timbre, respiración y textura) se generen con alta eficiencia.
Este sistema se basa en la cuantificación del vector residual (RVQ). En esta configuración, el audio sin procesar se comprime en tokens discretos en múltiples capas (libros de códigos). La primera capa captura las características acústicas primarias, mientras que las capas posteriores capturan los “residuales” o los errores restantes de la capa anterior. Esto permite que el modelo reconstruya audio de alta fidelidad de 44,1 kHz mientras mantiene un recuento de tokens manejable para la arquitectura Transformer.
Control emocional mediante aprendizaje en contexto y etiquetas en línea
Fish Audio S2-Pro logra lo que los desarrolladores describen como “emoción absurdamente controlable” a través de dos mecanismos principales: aprendizaje en contexto sin disparos y control en línea del lenguaje natural.
Aprendizaje en contexto (ICL):
A diferencia de generaciones anteriores de TTS que requerían un ajuste explícito para imitar una voz específica, S2-Pro utiliza la capacidad del Transformer para realizar aprendizaje en contexto. Al proporcionar un clip de audio de referencia (idealmente entre 10 y 30 segundos), el modelo extrae la identidad y el estado emocional del hablante. El modelo trata esta referencia como un prefijo en su ventana de contexto, lo que le permite continuar la “secuencia” con la misma voz y estilo.
Etiquetas de control en línea:
El modelo apoya transiciones emocionales dinámicas dentro de un solo paso generacional. Debido a que el modelo se entrenó con datos que contienen marcadores lingüísticos descriptivos, los desarrolladores pueden insertar etiquetas de lenguaje natural directamente en el mensaje de texto. Por ejemplo:
[whisper] tengo un secreto [laugh] que no puedo decirte.
El modelo interpreta estas etiquetas como instrucciones para modificar las fichas acústicas en tiempo real, ajustando el tono, la intensidad y el ritmo sin requerir una incorporación emocional separada o un vector de control externo.
Comparativas de rendimiento e integración de SGLang
Al integrar TTS en aplicaciones en tiempo real, la principal limitación es el “Tiempo para el primer audio” (TTFA). Fish Audio S2-Pro está optimizado para una latencia inferior a 150 ms, con pruebas comparativas en hardware NVIDIA H200 que alcanzan aproximadamente 100 ms.
Varias optimizaciones técnicas contribuyen a este rendimiento:
SGLang y RadixAttention: S2-Pro está diseñado para funcionar con SGLang, un marco de servicio de alto rendimiento. Utiliza RadixAttention, que permite una gestión eficiente de la caché de valores clave (KV). En un entorno de producción donde se usa repetidamente el mismo mensaje de voz “maestro” (clip de referencia), RadixAttention almacena en caché los estados KV del prefijo. Esto elimina la necesidad de volver a calcular el audio de referencia para cada solicitud, lo que reduce significativamente el tiempo de precompletación. Generación de paso único para múltiples hablantes: la arquitectura permite que múltiples identidades de hablantes estén presentes dentro de la misma ventana de contexto. Esto permite la generación de diálogos complejos o narraciones de varios personajes en una única llamada de inferencia, evitando la sobrecarga de latencia al cambiar de modelo o recargar pesos para diferentes hablantes.
Implementación técnica y escalamiento de datos
El repositorio Fish Speech proporciona una implementación basada en Python que utiliza PyTorch. El modelo se entrenó en un conjunto de datos diverso que comprende más de 300.000 horas de audio multilingüe. Esta escala es lo que permite el rendimiento sólido del modelo en diferentes idiomas y su capacidad para manejar vocalizaciones “no verbales” como suspiros o vacilaciones.
El plan de formación implica:
Entrenamiento VQ-GAN: entrenamiento del cuantificador para asignar audio a un espacio latente discreto. Capacitación LLM: Capacitación de los transformadores Dual-AR para predecir esos tokens latentes en función de texto y prefijos acústicos.
El VQ-GAN utilizado en S2-Pro está específicamente ajustado para minimizar los artefactos durante el proceso de decodificación, asegurando que incluso con altas relaciones de compresión, el audio reconstruido permanezca “transparente” (indistinguible de la fuente al oído humano).
Conclusiones clave
Arquitectura AR dual (lento/rápido): a diferencia de los modelos de una sola etapa, S2-Pro divide las tareas entre un modelo ‘AR lento’ de parámetros 4B (para estructura lingüística y prosódica) y un modelo ‘AR rápido’ de parámetros 400M (para refinamiento acústico), optimizando tanto el detalle como la velocidad. Latencia inferior a 150 ms: Diseñado para IA conversacional en tiempo real, el modelo logra un tiempo hasta el primer audio (TTFA) de ~100 ms en hardware de alta gama, lo que lo hace adecuado para agentes en vivo y aplicaciones interactivas. Codificación RVQ jerárquica: mediante el uso de cuantificación de vector residual, el sistema comprime audio de 44,1 kHz en tokens discretos en múltiples capas. Esto permite al modelo reconstruir texturas vocales complejas, incluidas respiraciones y suspiros, sin la sobrecarga computacional de las formas de onda sin procesar. Aprendizaje en contexto Zero-Shot: los desarrolladores pueden clonar una voz y su estado emocional proporcionando un clip de referencia de 10 a 30 segundos. El modelo trata esto como un prefijo, adoptando el timbre y la prosodia del hablante sin requerir ajustes adicionales. Integración de RadixAttention y SGLang: optimizado para producción, S2-Pro aprovecha RadixAttention para almacenar en caché los estados KV de las indicaciones de voz. Esto permite una generación casi instantánea cuando se utiliza el mismo altavoz repetidamente, lo que reduce drásticamente la sobrecarga de precarga.
Consulte la tarjeta modelo y el repositorio. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 120.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.