Los agentes de voz fallan exactamente en las partes de una llamada que más importan: el número de pedido, los dígitos de devolución de llamada, la dirección de correo electrónico que la persona que llama debe escribir. Gradium AI lanzó un nuevo modelo de conversión de texto a voz y lo convirtió en el predeterminado en su API y Studio. La compañía reporta una tasa de aprobación humana del 81,0% en un conjunto de 500 oraciones en cinco idiomas, por delante de Cartesia Sonic 3.6 con un 75,1% y ElevenLabs v3 Conversational con un 65,4%. El tiempo hasta el primer audio es de 216 ms en P50 en Coval, 170 ms más rápido que el modelo al que reemplaza.
¿Es desplegable?
Sí, hoy, sin migración. Gradium activó el modelo como predeterminado en su API y Studio el 31 de agosto de 2026. Las voces existentes, incluidos los clones personalizados, siguen funcionando sin cambios.
El número de precisión
Gradium creó un conjunto de evaluación de 500 oraciones y lo abrió en Hugging Face bajo CC BY 4.0: 100 elementos en 10 criterios en cinco idiomas (EN, DE, FR, ES, PT). Siete criterios atómicos cubren ortografía, acrónimos, tokens alfanuméricos, fechas, números regulares, números grandes y flotantes y correo electrónico. Tres criterios compuestos (Órdenes, Ticket de TI, Reclamaciones) agrupan varios de ellos en un turno de agente realista.
La puntuación es humana y estricta. Una frase sólo se aprueba si un evaluador independiente y nativo escucha cada elemento pronunciado correcta y completamente; un dígito caído falla la oración. El audio se normalizó en cuanto al volumen, el orden fue aleatorio y los evaluadores limitaron a 40 comparaciones con una pausa forzada.
Combinados en los diez criterios y promediados en los cinco idiomas con el mismo peso: Gradium TTS 81,0%, Cartesia Sonic 3.6 75,1%, ElevenLabs v3 Conversational 65,4%, Fish Audio S2.1 Pro 49,5%, Inworld TTS 1.5 Max 46,5%. Todo generado en agosto de 2026 con la configuración predeterminada.
El número de latencia
En el punto de referencia TTS de Coval, Gradium reporta un tiempo P50 de 216 ms hasta el primer audio, 170 ms más rápido que el modelo al que reemplaza. La cifra más útil es la dispersión: un rango intercuartil p75-p25 de 30 ms en 480 ejecuciones, el más ajustado de los cinco modelos probados. Cartesia Sonic 3.6 tiene una mediana de 454 ms con una extensión de 165 ms, el 36% de su propia mediana, y las personas que llaman experimentan giros de cola en lugar de medianas.
Gradium no es el modelo más rápido en esa tabla. Inworld TTS 2 registra una mediana de 166 ms; Fish Audio S2.1 Pro (291 ms) y ElevenLabs v3 Conversational (329 ms) siguen a Gradium. La afirmación que se hace tiene que ver con la posición conjunta: la tasa de falla más baja en el primer audio por debajo de 250 ms, con muy poca variación.
Empezando
Los usuarios existentes no necesitan hacer nada. Los nuevos equipos instalan el SDK de Python, apuntan al punto final WebSocket TTS y reutilizan las identificaciones de voz existentes. Gradium ofrece 1 millón de créditos para informes completos de fallas en su Discord.
Conclusiones clave
El nuevo modelo Gradium TTS está activo y predeterminado a partir del 31 de agosto de 2026; no se necesita migración. Tasa de aprobación humana del 81,0 % en 500 frases difíciles, por delante de Cartesia, ElevenLabs, Fish Audio e Inworld. Tiempo P50 de 216 ms hasta el primer audio en Coval, con un intercuartil de 30 ms repartido en 480 ejecuciones. Lee números de teléfono, correos electrónicos, IBAN y códigos de referencia sin necesidad de normalización de texto. Punto de referencia realizado por el proveedor, pero el conjunto de evaluación de 500 oraciones está abierto en Hugging Face bajo CC BY 4.0.
Consulte la publicación del lanzamiento y el conjunto de datos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 150.000 ml y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.
¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros
Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.