UT Austin y ServiceNow Research Team lanza Au-Harness: un conjunto de herramientas de código abierto para la evaluación holística de Audio LLMS

Voice AI se está convirtiendo en una de las fronteras más importantes en la IA multimodal. Desde asistentes inteligentes hasta agentes interactivos, la capacidad de comprender y razonar sobre el audio está remodelando cómo las máquinas se relacionan con los humanos. Sin embargo, si bien los modelos han crecido rápidamente en capacidad, las herramientas para evaluarlos no han mantenido el ritmo. Los puntos de referencia existentes permanecen fragmentados, lentos y enfocados estrechamente, lo que a menudo hace que sea difícil comparar modelos o probarlos en entornos realistas y múltiples.

Para abordar esta brecha, UT Austin y ServiceNow Research Team ha lanzado Au-harnessun nuevo conjunto de herramientas de código abierto creado para evaluar grandes modelos de lenguaje de audio (LALMS) a escala. Au-Harness está diseñado para ser rápido, estandarizado y extensible, lo que permite a los investigadores probar modelos en una amplia gama de tareas, desde el reconocimiento de voz hasta el razonamiento de audio complejo, dentro de un solo marco unificado.

¿Por qué necesitamos un nuevo marco de evaluación de audio?

Los puntos de referencia de audio actuales se han centrado en aplicaciones como el reconocimiento de voz a texto o emociones. Marcos como Audio, Banco de vozy Dynamicsuperb-2.0 Cobertura ampliada, pero dejaron algunas brechas realmente críticas.

Se destacan tres problemas. Primero es cuellos de botella de rendimiento: Muchos kits de herramientas no aprovechan el lote o el paralelismo, lo que hace que las evaluaciones a gran escala lentan dolorosamente. El segundo es provocando inconsistencialo que hace que los resultados en todos los modelos sean difíciles de comparar. Tercero es alcance de la tarea restringida: Las áreas clave como la diarización (que hablaban cuándo) y el razonamiento hablado (siguientes instrucciones entregadas en audio) faltan en muchos casos.

Estos espacios limitan el progreso de los Lalmos, especialmente a medida que evolucionan hacia agentes multimodales que deben manejar interacciones largas, con contexto y múltiples giros.

https://arxiv.org/pdf/2509.08031

¿Cómo mejora Au-Harness?

El equipo de investigación diseñó Au-Harness con enfoque en la velocidad. Integrando con el motor de inferencia VLLMpresenta un programador de solicitudes basado en token que gestiona evaluaciones concurrentes en múltiples nodos. También figura conjuntos de datos para que las cargas de trabajo se distribuyan proporcionalmente a través de los recursos de cálculo.

Este diseño permite la escala casi lineal de las evaluaciones y mantiene el hardware completamente utilizado. En la práctica, Au-Harness ofrece 127% de rendimiento más alto y reduce el Factor en tiempo real (RTF) en casi un 60% en comparación con los kits existentes. Para los investigadores, esto se traduce en evaluaciones que una vez tardó días en completarse en horas.

¿Se pueden personalizar las evaluaciones?

La flexibilidad es otra característica central de Au-Harness. Cada modelo en una ejecución de evaluación puede tener sus propios hiperparámetros, como la temperatura o la configuración de token máximo, sin romper la estandarización. Las configuraciones permiten filtrado del conjunto de datos (por ejemplo, por acento, longitud de audio o perfil de ruido), que permite diagnósticos dirigidos.

Quizás lo más importante, Au-Harness apoya evaluación de diálogo múltiple. Los kits de herramientas anteriores se limitaron a tareas de un solo cambio, pero los agentes de voz modernos operan en conversaciones extendidas. Con Au-Harness, los investigadores pueden comparar la continuidad del diálogo, el razonamiento contextual y la adaptabilidad a través de intercambios de múltiples pasos.

¿Qué tareas cubre Au-Harness?

Au-Harness expande drásticamente la cobertura de tareas, apoyando 50+ conjuntos de datos, más de 380 subconjuntos y 21 tareas en seis categorías:

  • Reconocimiento de voz: De ASR simple a discurso de forma larga y conmutador de código.
  • Paralingüística: Emoción, acento, género y reconocimiento de oradores.
  • Comprensión de audio: Escena y comprensión musical.
  • Comprensión del lenguaje hablado: Respuesta de preguntas, traducción y resumen del diálogo.
  • Razonamiento del lenguaje hablado: Siguiente a la codificación, llamadas de funciones e instrucción de múltiples pasos.
  • Seguridad y seguridad: Evaluación de robustez y detección de suplantación.

Dos innovaciones se destacan:

  • Diarización adaptativa de LLMque evalúa la diarización a través de modelos neuronales especializados en lugar de especializados.
  • Razonamiento del lenguaje habladoque prueba la capacidad de los modelos para procesar y razonar sobre las instrucciones habladas, en lugar de simplemente transcribirlas.
https://arxiv.org/pdf/2509.08031

¿Qué revelan los puntos de referencia sobre los modelos de hoy?

Cuando se aplica a sistemas principales como GPT-4O, QWEN2.5-OMNIy Voxtral-mini-3bAu-Harness destaca tanto las fortalezas como las debilidades.

Los modelos sobresalen en ASR y respuesta a las preguntasmostrando una fuerte precisión en el reconocimiento de voz y las tareas de control de calidad. Pero se quedan atrás tareas de razonamiento temporalcomo diarización y en seguimiento de instrucciones complejasparticularmente cuando se dan instrucciones en forma de audio.

Un hallazgo clave es el brecha de modalidad de instrucciones: Cuando las tareas idénticas se presentan como instrucciones habladas en lugar de texto, el rendimiento cae tanto como 9.5 puntos. Esto sugiere que si bien los modelos son expertos en procesar un razonamiento basado en texto, adaptar esas habilidades a la modalidad de audio sigue siendo un desafío abierto.

https://arxiv.org/pdf/2509.08031

Resumen

Au-Harness marca un paso importante hacia la evaluación estandarizada y escalable de los modelos de lenguaje de audio. Al combinar eficiencia, reproducibilidad y amplia cobertura de tareas, incluida la diarización y el razonamiento hablado, aborda las brechas de larga data en la IA de la voz de la evaluación comparativa. Su lanzamiento de código abierto y su tabla de clasificación pública invitan a la comunidad a colaborar, comparar y superar los límites de lo que los sistemas de IA de voz pueden lograr.


Mira el Papel, Proyecto y Página de Github. No dude en ver nuestro Página de Github para tutoriales, códigos y cuadernos. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.