Microsoft AI lanza MAI-Transcribe-2-Streaming: modelo número uno de voz a texto en tiempo real en análisis artificial

Microsoft AI ha lanzado MAI-Transcribe-2-Streaming, su primer modelo de transmisión de voz a texto (STT). Se lanzó el 1 de octubre de 2026, junto con dos modelos de texto a voz, MAI-Voice-2.1 y MAI-Voice-2.1-Flash. Artificial Analysis lo clasifica como el número 1 de 38 modelos en cuanto a precisión de la transcripción final y primera parcial. El modelo apunta a agentes de voz, subtítulos en vivo y dictado, donde la latencia decide la experiencia.

Lo que Microsoft envió

MAI-Transcribe-2-Streaming es el hermano en tiempo real del lote MAI-Transcribe-2, lanzado en septiembre. Transcribe 60 idiomas con detección de idioma automática y continua. El audio se transmite continuamente y el texto se transmite mientras el orador sigue hablando.

El modelo emite sus primeras hipótesis, llamadas parciales, poco más de 100 ms después de recibir el audio. Revisa esos parciales a medida que llega el contexto y luego confirma una transcripción final estable. Por lo tanto, un agente puede comenzar a razonar o llamar a herramientas a mitad de una frase. El equipo de Microsoft afirma que sus pruebas internas muestran que las palabras aparecen 2 veces más rápido que su competidor más cercano.

Lo que midió el análisis artificial

El índice AA-WER Streaming utiliza aproximadamente 8 horas de audio. La combinación es AA-AgentTalk (50%), VoxPopuli (25%) y Earnings22 (25%). La latencia se mide desde el final del discurso, según lo detectado por SileroVAD.

Transcripción final: 2,5 % WER a los 0,13 s después del final del discurso, n.º 1 de 38 modelos. Primera transcripción parcial: 2,5 % WER a los 0,12 s después del final del discurso, también n.º 1. Subcampeón: Grok Voice Transcribe 2.0 con 2,7% y 0,49s. Muse Voice Transcribe al 3,1% y 0,16s. No es el más rápido: Cartesia Ink-2 (puntos finales externos) arroja resultados finales en 0,07 s, pero con un WER del 4,0 %.

El primer parcial es tan preciso como la transcripción final. Eso es importante para los agentes que actúan antes de que termine el orador. Microsoft también sitúa el modelo en la frontera de Pareto entre precisión y latencia.