Los mejores modelos de reconocimiento de voz abierto (ASR) en 2026: comparación de WER, idiomas, latencia y licencia

El reconocimiento de voz abierto dejó de ser un monocultivo de Whisper en algún momento de los últimos doce meses. En marzo de 2026, Cohere lanzó Transcribe, un modelo 2B Apache 2.0 que ocupó la cima de la tabla de clasificación ASR abierta de Hugging Face con una tasa promedio de error de palabras del 5,42%. Cinco semanas después, IBM envió Granite Speech 4.1 2B al 5,33%. Desde entonces, ARK-ASR-3B y MOSS-Transcribe-preview-2B han publicado cifras aún más bajas.

La cima de esa clasificación ahora está separada por menos de un punto WER. Esto tiene una consecuencia específica para cualquiera que elija un modelo: el rango ya no es la variable decisiva. La licencia, la cobertura de idiomas, el soporte de transmisión y el costo por hora de audio son. Este resumen compara el campo de los cuatro.

Primero, un problema con el número de la tabla de clasificación que todos citan.

El promedio de la tabla de clasificación Open ASR no es una cantidad fija única, y no todos los modelos que figuran actualmente uno al lado del otro obtuvieron la misma puntuación.

El 5,42% de Cohere es un promedio de ocho conjuntos de pruebas de inglés, incluido TED-LIUM. Eso verifica: AMI 8.13, Earnings-22 10.86, GigaSpeech 9.34, LibriSpeech clean 1.25, LibriSpeech other 2.37, SPGISpeech 3.08, TED-LIUM 2.49, VoxPopuli 5.87 promedia exactamente 5.42.

El 5,04% de ARK-ASR-3B es un promedio de siete conjuntos. TED-LIUM está ausente. La tarjeta MOSS-Transcribe-preview-2B establece esto explícitamente: TED-LIUM no forma parte actualmente de la clasificación y, por lo tanto, está excluido.

TED-LIUM es uno de los conjuntos más fáciles de la suite, por lo que dejarlo aumenta el promedio. Vuelva a calcular las puntuaciones por conjunto de datos publicadas por Cohere en los mismos siete conjuntos que informa ARK y Cohere llega a 5,84, no a 5,42. Haga lo mismo con Granite Speech 4.1 2B y pasará de 5,33 a 5,65. En términos comparables, la ventaja de ARK es mayor de lo que implican las cifras de los titulares, no menor, pero el punto es que no se puede restar una cifra publicada de otra y obtener una respuesta significativa.

Dos advertencias más pertenecen a la misma página:

Algunas puntuaciones están abiertamente ajustadas a la tabla de clasificación: la tarjeta MOSS-Transcribe-preview-2B indica que el modelo se ajustó con aprendizaje por refuerzo en las divisiones de entrenamiento de Open ASR Leaderboard. Eso se revela, que es más que la mayoría, pero significa que la puntuación mide el punto de referencia en lugar de la capacidad.

Los datos de seguimiento privado reordenan el tablero: Appen contribuyó con conjuntos de evaluación retenidos que cubren acentos australianos, canadienses, indios y estadounidenses en condiciones escritas y conversacionales. Cuando se activan esos conjuntos privados, zoom/scribe_v1 pasa del n.° 4 al n.° 1 y el líder de la tabla de clasificación pública baja una posición. Los modelos optimizados para una lectura clara del habla se degradan desproporcionadamente en el audio conversacional espontáneo.

Utilice la tabla de clasificación para crear una lista corta. No lo utilices para elegir un ganador.

El nivel de precisión

Cohere Transcribe (2B, Apache 2.0, 14 idiomas) es el modelo que realmente entró en producción. Se descargó más de 620.000 veces el mes pasado y tiene soporte de tiempo de ejecución en transformadores, vLLM, mlx-audio para Apple Silicon, un puerto Rust y una compilación WebGPU. Es un codificador Conformer con un decodificador Transformer liviano, entrenado desde cero. Cohere también realizó una evaluación de preferencias humanas, donde anotadores capacitados calificaron las transcripciones para determinar la preservación del significado, las alucinaciones y las entidades nombradas: una tasa de ganancia promedio del 61 %, 78 % contra IBM Granite 4.0 1B Speech y 64 % contra Whisper grande-v3.

La sección de limitaciones de su tarjeta modelo es inusualmente honesta y debe leerse antes de comprometerse. No hay detección automática de idioma, ni marcas de tiempo ni registro, y el modelo está ansioso por transcribir el silencio, por lo que Cohere recomienda anteponer un VAD o una puerta de ruido. El repositorio también está protegido por un acuerdo de información de contacto a pesar de la licencia Apache 2.0.

Granite Speech 4.1 2B (2B, Apache 2.0) es la mejor opción si necesita capacidad en lugar de un número menor. Seis idiomas para ASR más traducción de voz bidireccional, sesgo de lista de palabras clave para nombres y jerga, puntuación y uso de mayúsculas y minúsculas en alemán. Capacitado en 174.000 horas. RTFx 231.29. IBM también incluye dos hermanos: -plus agrega ASR atribuido al hablante y marcas de tiempo a nivel de palabra, y -nar se analiza a continuación.

Canary-Qwen-2.5B (2.5B, CC-BY-4.0, inglés) empareja un codificador FastConformer con un decodificador Qwen3-1.7B y se ejecuta en dos modos: transcripción pura o modo LLM donde el decodificador resume y responde preguntas sobre la transcripción. WER del 5,63 % en RTFx 418. Tenga en cuenta que se sobremuestreó AMI a aproximadamente el 15 % de los datos de entrenamiento, lo que sesga la salida hacia transcripciones textuales que preservan la disfluencia. Esta es una característica para el trabajo legal y una molestia para las notas de las reuniones.

Qwen3-ASR-1.7B (Apache 2.0) cubre 52 idiomas y dialectos (30 idiomas más 22 dialectos chinos) con un 5,76%. Se envía con un conjunto completo de herramientas de inferencia y un modelo de alineación forzada independiente para marcas de tiempo en 11 idiomas. Para cualquier cosa relacionada con el lenguaje regional mandarín o chino, este es el punto de partida obvio.

El nivel de rendimiento

La precisión en la parte superior del campo ahora varía en aproximadamente un punto WER. El rendimiento varía en más de un orden de magnitud, lo que significa que el rendimiento suele decidir la factura.

Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) es el líder en rendimiento entre los modelos abiertos multilingües con RTFx 3332.74 en 25 idiomas europeos con identificación automática de idioma, y ​​maneja hasta 24 minutos en una sola pasada en un A100 de 80 GB. Cuesta 6,32% WER, aproximadamente un punto más que Granite 4.1 2B, por aproximadamente catorce veces el audio por segundo de GPU.

Granite Speech 4.1 2B-NAR es el resultado de ingeniería más interesante. No es autorregresivo: edita una hipótesis CTC en un solo paso hacia adelante utilizando un LLM bidireccional, alcanzando RTFx ~1820 en un H100 con un tamaño de lote 128. Para llegar allí, abandona el japonés, la traducción de voz y el sesgo de palabras clave.

Qwen3-ASR-0.6B mantiene los 52 idiomas y alcanza un rendimiento de 2000× con una simultaneidad de 128.

El nivel de transmisión

Un WER por lotes parece ser la prueba equivocada para un modelo de streaming, y la tabla de clasificación los puntúa de todos modos. Voxtral Realtime se ubica en 7,68% y Kyutai STT 2.6B en 6,40%, ambos por debajo de Whisper, y ninguno de los números le dice nada útil sobre su uso previsto.

Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 idiomas) es un modelo de lenguaje 3.4B junto con un codificador de audio causal 970M entrenado desde cero, con atención de ventana deslizante en ambas mitades para una transmisión eficaz e ilimitada. El retraso de la transcripción se puede configurar en pasos de 80 ms, desde 80 ms hasta 1200 ms, además de una opción independiente de 2400 ms; Mistral recomienda 480 ms como el punto óptimo e informa que en esa configuración coincide con los principales modelos abiertos fuera de línea. Se ejecuta en una única GPU de 16 GB y tenía compatibilidad con vLLM Realtime API desde el día 0.

Kyutai STT (CC-BY-4.0) viene en dos formas: un modelo de ~1B inglés/francés con un retraso de 0,5 s y un detector de actividad de voz semántica incorporado, y un modelo de 2,6 B solo en inglés con un retraso de 2,5 s. Para los agentes de voz, el VAD semántico importa más que el retraso de la transcripción: predice cuándo el hablante ha terminado realmente, que es lo que gobierna la latencia percibida al tomar turnos. Un H100 sirve 400 transmisiones simultáneas en tiempo real.

El nivel de cobertura

El ASR omnilingüe de Meta (Apache 2.0, corpus CC-BY) no compite en WER y no debe evaluarse como si lo fuera. Cubre más de 1600 idiomas de forma nativa y se extiende a más de 5400 a través del aprendizaje en contexto sin disparos, construido sobre un codificador wav2vec 2.0 escalado a 7B y entrenado previamente en aproximadamente 4,3 millones de horas. La variante 7B LLM-ASR logra una tasa de error de caracteres inferior al 10 % en el 78 % de los idiomas admitidos, incluidos más de 500 nunca antes atendidos por ningún sistema ASR. Los tamaños de codificador van desde 300M hasta 7B. Meta también lanzó el Corpus ASR omnilingüe que cubre más de 350 idiomas desatendidos.

Whisper large-v3 (1.55B, MIT, 99 idiomas) ha sido superado en precisión por aproximadamente diez modelos abiertos, y sigue siendo el valor predeterminado correcto para una gran clase de proyectos. El MIT es la licencia con menos cargas en este campo. El ecosistema de tiempo de ejecución (whisper.cpp, más rápido-whisper, WhisperX) no tiene equivalente entre las versiones más recientes. Si su requisito es “algo de idioma, algo de hardware, sin licencia de abogado”, sigue siendo la respuesta.

La ventaja de la investigación

diffusion-gemma-asr-small de la startup YC Interfaze es el lanzamiento arquitectónicamente más creativo del año. Produce transcripciones mediante difusión paralela eliminando el ruido sobre un lienzo de 256 tokens en 8 a 16 pasos, por lo que el costo de decodificación no aumenta con la longitud de la transcripción. Solo se entrenaron ~42 millones de parámetros (0,16% de los pesos) encima de un DiffusionGemma 26B congelado y un codificador pequeño como un susurro congelado. Alcanza un WER del 6,6 % en la prueba de limpieza de LibriSpeech a aproximadamente entre 11 y 17 veces en tiempo real. También alcanza el 15,7% en FLEURS English y el 29,6% CER en FLEURS Mandarin, así que trate la cifra de LibriSpeech como el límite máximo. Nadie debería implementar esto. Todos los que trabajan en ASR deberían leerlo.

MOSS-Transcribe-Diarize 0.9B (Apache 2.0, más de 50 idiomas) resuelve el problema que la mayoría de las redadas ignoran: emite etiquetas de hablante, marcas de tiempo de palabras y transcripciones en una generación en lugar de encadenar ASR a una pila de diario separada. Contexto de 128k, aproximadamente 90 minutos de audio en una sola pasada, RTF ~0,017 en un RTX 4090, con polarización de palabras activas.

La licencia dividida nadie la lee hasta su implementación

Esta es la sección que realmente bloquea el envío y el campo se divide claramente:

Apache 2.0: Cohere Transcribe, Granite Speech 4.1 (las tres variantes), Qwen3-ASR (ambos tamaños), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR, MOSS-Transcribe. Sin obligación de atribución, uso comercial ilimitado. Tenga en cuenta que el repositorio de Cohere está protegido por un acuerdo de información de contacto, aunque la licencia en sí es Apache 2.0.

MIT: Whisper grande-v3. La opción más permisiva en el campo.

CC-BY-4.0: Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT. Utilizable comercialmente, pero se requiere atribución. Para un producto integrado o una API de marca blanca, esa es una obligación de cumplimiento real y es la razón más común por la que los equipos terminan enviando un modelo que no es el más preciso que probaron.

El ASR omnilingüe de Meta divide los dos: Apache 2.0 para los modelos, CC-BY para el corpus.

Cómo elegir realmente

Ejecute este orden, no solo el orden de la tabla de clasificación:

Licencia: si la atribución es un bloqueador, CC-BY-4.0 elimina Parakeet, Canary-Qwen y Kyutai antes de comparar cualquier cosa. Cobertura de idiomas: los 14 idiomas de Cohere, los 6 de Granite y el inglés de Canary solamente son límites estrictos, no flexibles. Cohere además no tiene detección automática de idioma, por lo que debes conocer el idioma de antemano. Streaming o lote: Esto es arquitectónico. Ninguna cantidad de ajustes convierte un codificador-decodificador fuera de línea en un modelo de transmisión de baja latencia. Luego mida el WER con su propio audio: la diferencia entre los diez mejores modelos en el benchmark público es inferior a un punto. La extensión de su audio acentuado, ruidoso y específico del dominio será varias veces mayor y no clasificará los modelos en el mismo orden. Luego, calcule el costo por hora de audio en sus propias GPU: las cifras de RTFx se miden en lotes grandes en el hardware del centro de datos y no se transfieren.