NVIDIA lanza Nemotron 3 Diarization: un modelo de peso abierto con 100 millones de parámetros que rastrea 8 parlantes en tiempo real

NVIDIA ha lanzado Nemotron 3 Diarization, un modelo de diarización de altavoces de peso abierto en Hugging Face. Responde a una pregunta sobre cualquier conversación: quién habló y cuándo. El modelo de 100M de parámetros rastrea hasta 8 hablantes, incluso cuando las voces se superponen. Un punto de control maneja tanto las grabaciones sin conexión como la transmisión en tiempo real.

¿Es desplegable? Sí. Los pesos se publican bajo la licencia OpenMDW 1.1, que permite el uso comercial. Se ejecuta en Linux a través de NVIDIA NeMo, utilizando GPU Ampere, Ada Lovelace, Hopper o Blackwell.

¿Por qué la diarización de los oradores?

El reconocimiento automático de voz (ASR) le proporciona las palabras. No te dice quién las dijo. Sin atribución, un resumidor no puede decir quién asumió un compromiso o quién planteó una objeción.

La diarización genera los intervalos de tiempo en los que cada hablante está activo. Esas marcas de tiempo se combinan con la salida ASR para producir una transcripción atribuida al hablante. Las herramientas para reuniones, el análisis de llamadas, los canales de podcasts y la memoria del agente de voz dependen de este paso.

Qué cambió con respecto a Streaming Sortformer

El punto de control Streaming Sortformer anterior de NVIDIA, diar_streaming_sortformer_4spk-v2.1, admitía 4 altavoces. Nemotron 3 Diarization duplica ese límite a 8. Según el anuncio de NVIDIA, el objetivo es un audio multipartito desordenado donde la gente habla a la vez.

Cómo funciona la arquitectura

El modelo acepta audio de un solo canal de 16 kHz en formato .wav, .flac, .opus o .mp3. Convierte el audio en funciones de espectrograma Mel con un paso de 10 ms. Las funciones se apilan en un factor de 8, lo que produce fotogramas de codificador de 80 ms.

Un codificador transformador de 31 capas con incrustaciones posicionales rotativas (RoPE) procesa esos cuadros. Luego, una capa Conv1D aumenta las muestras de las predicciones a una resolución de 10 ms. La salida es una [T, 8] tensor de probabilidades de actividad por hablante.

Este diseño maneja la superposición directa. Si 2 personas hablan al mismo tiempo, se activan 2 canales en el mismo cuadro.

El modelo sigue el enfoque de Sortformer de ordenar los altavoces por hora de llegada. La primera voz nueva toma el canal 1, la siguiente toma el canal 2, y así sucesivamente. Esto mantiene las etiquetas estables en los fragmentos de transmisión, por lo que el modelo no tiene que volver a hacer coincidir los altavoces con los canales para cada fragmento.

La transmisión utiliza 2 mecanismos de memoria. La caché de oradores de orden de llegada (AOSC) mantiene la información de los oradores de fragmentos anteriores. Una cola FIFO proporciona contexto de marco reciente. Las etiquetas son anónimas y su asignación a identidades reales se deja en manos de las aplicaciones posteriores.

4 puntos de funcionamiento de latencia

La latencia del búfer de entrada es igual a (fragmento + contexto derecho) × 80 ms. La tabla utiliza el DER de conjunto completo DIHARD III y el rendimiento compilado por lotes 32 de la tarjeta modelo.

ConfiguraciónLatencia del búferDIHARD III DERRTFx (lote 32, compilado)Estilo sin conexión30,4 s12,73%15,113×Latencia baja1,04 s13,18%865×Latencia muy baja 0,64 s13,28%579×Latencia ultrabaja0,32 s13,55%292×

Esta latencia excluye el tiempo de computación, redes y ASR. Técnicamente, el modelo puede ejecutarse con un búfer de 80 ms, pero 0,32 s es la configuración más baja recomendada.

Resultados de referencia

En los resultados iniciales de Diarization-Bench de Voice Arena, el modelo ocupó el primer lugar entre 12 sistemas y 17 configuraciones. La prueba cubrió 139 conversaciones en inglés por un total de aproximadamente 22 horas. Obtuvo un DER del 14,72% frente al 19,3% del sistema que le sigue en la clasificación, aproximadamente una reducción relativa del 24%. NVIDIA señala que estos resultados pueden cambiar una vez que Voice Arena complete su evaluación de la Versión 1.

Frente a la línea de base de 4 altavoces con una latencia de 1,04 s, DER cayó en las 8 condiciones de evaluación. Las reducciones relativas oscilaron entre el 9,0% en CALLHOME-Part2 y el 65,2% en NOTSOFAR1 MHM. La media no ponderada entre las 8 condiciones fue del 41,0%.

Hay una regresión. En CALLHOME de 2 altavoces a 30,4 s, DER aumentó del 5,68% al 5,98%. El CALLHOME-Part2 completo aún mejoró del 10,32% al 9,10%.

El rendimiento también aumentó. A los 30,4 s, el modelo alcanzó 15.113× RTFx frente a 2.619× de la línea base. Las pruebas utilizaron BF16 en una NVIDIA RTX PRO 5000 con torch.compile(). Estos son números por lotes, no latencia de aplicaciones de flujo único.

Datos de entrenamiento

La formación combinó unas 10.000 horas de conversaciones reales con 82.611 horas de mezclas simuladas de múltiples interlocutores. La mezcla incluía audio de varios altavoces del mundo real con licencia de David AI. Al agregar los datos de David AI, se redujo el DER compuesto del 11,19% al 10,42%. El audio fuente con licencia para las mezclas simuladas abarca 21 idiomas.

Empezando

Instale NVIDIA NeMo Speech con Python 3.12 o posterior:

uv pip instala ‘nemo-toolkit'[asr]’
from nemo.collections.asr.models import SortformerEncLabelModel diar_model = SortformerEncLabelModel.from_pretrained(“nvidia/Nemotron-3-Diarization”) diar_model.eval() segmentos = diar_model.diarize(audio=[“conversation.wav”]tamaño_lote=1)

Los segmentos de salida toman el formato inicio fin altavoz_id. Para entender también las palabras, empareje el modelo con Parakeet TDT 0.6B v3 usando la guía de integración ASR.

La demostración en vivo Space ofrece conversaciones sintéticas, un micrófono en vivo, un micrófono en vivo multilingüe y carga de audio. Para producción, NVIDIA incluye Baseten y DigitalOcean. La compatibilidad en el dispositivo está disponible a través de Argmax Pro SDK 3. El modelo aún no está disponible a través de los proveedores de inferencia de Hugging Face.

El modelo tiene límites. Las grabaciones con más de 8 hablantes pueden producir palabras perdidas o mal asignadas. El ruido intenso, la reverberación y la captura de campo lejano también pueden aumentar las tasas de error.

Explicador interactivo