SpaceXAI lanza Grok Voice Transcribe 2.0: una API de voz a texto que afirma tener el doble de precisión que 1.0 a 0,10 dólares por hora

SpaceXAI ha lanzado Grok Voice Transcribe 2.0, su modelo más nuevo de conversión de voz a texto (STT). El equipo de desarrollo afirma que es dos veces más preciso que Grok Voice Transcribe 1.0 por el mismo precio. El modelo apunta al audio duro: líneas telefónicas ruidosas, voces en competencia, acentos locales y credenciales habladas. Se ejecuta en modos de transmisión por lotes y en tiempo real a través de la API de voz a texto.

¿Es desplegable? Sí, como API alojada. Está disponible hoy con el ID de modelo grok-voice-transcribe-2.0. SpaceXAI no ha anunciado pesos abiertos, por lo que el autohospedaje no es una opción.

¿Qué es Grok Voice Transcribe 2.0?

Grok Voice Transcribe 2.0 se basa en el modelo básico de audio detrás de Grok Voice. El equipo de SpaceXAI afirma que Grok Voice ya gestiona decenas de miles de llamadas de atención al cliente al día. También transcribe millones de horas de narración en vídeo y ejecuta el asistente Grok en vehículos Tesla.

Los datos de entrenamiento son audio en vivo, ruidoso y multilingüe grabado en diversos entornos. Luego, SpaceXAI perfeccionó el modelo con un entrenamiento posterior.

Puntos de referencia: lo que informa SpaceXAI

SpaceXAI informa que ocupa el primer lugar en precisión entre 32 modelos de transmisión en la clasificación pública de Análisis Artificial. Ese punto de referencia, AA-WER Streaming, utiliza aproximadamente 8 horas de audio. Pondera AA-AgentTalk en un 50%, VoxPopuli en un 25% y Earnings22 en un 25%. Consulte la metodología para obtener más detalles.

SpaceXAI también mide la tasa de error de palabras (WER) en 4 conjuntos internos extraídos del tráfico de producción:

Telefonía (8 kHz): llamadas de atención al cliente en inglés Conversacional: conversaciones en inglés con Grok Credenciales: números de teléfono, correos electrónicos y direcciones en inglés Frases cortas: declaraciones del asistente de voz en 19 idiomas

La versión 2.0 mejora la 1.0 en los 4 conjuntos. En telefonía, SpaceXAI dice que lidera todos los modelos que la empresa probó. Estos resultados internos son informados por los proveedores y no se reproducen de forma independiente.

Transcripción multilingüe y cambio de idioma

El modelo transcribe docenas de idiomas y detecta el idioma automáticamente. También sigue los cambios de idioma a mitad de la grabación en una sola pasada. El equipo de SpaceXAI considera que la precisión multilingüe es la mayor mejora con respecto a la versión 1.0.

Las frases cortas, como las órdenes en el coche, le dan al modelo un pequeño contexto para identificar el idioma. En ese conjunto, el WER cae del 20,6% al 6,8%. Eso equivale a aproximadamente un 67% menos de errores de palabras.

Los documentos enumeran 25 idiomas para el formato escrito de números, monedas y unidades.