¿Escuchado sobre la inteligencia general artificial (AGI)? Conocer a su contraparte auditivaInteligencia general de audio. Con Audio Flamingo 3 (AF3)Nvidia presenta un salto importante en cómo las máquinas entienden y razonan sobre el sonido. Si bien los modelos pasados podrían transcribir el habla o clasificar los clips de audio, carecían de la capacidad de interpretar el audio de una manera rica en contexto y de forma humana: discurso de acceso, sonido ambiental y música, y sobre extendidas duraciones. AF3 cambia eso.
Con Audio Flamingo 3, Nvidia presenta Un modelo de audio-lenguaje grande de código abierto (LALM) Eso no solo escucha sino que también entiende y razones. Construido en un plan de estudios de cinco etapas y alimentado por el codificador AF-Whisper, AF3 admite largas entradas de audio (hasta 10 minutos), chat múltiple de audio múltiple, pensamiento a pedido e incluso interacciones de voz a voz. Esto establece una nueva barra para cómo interactúan los sistemas de IA con el sonido, acercándonos un paso más cerca de AGI.
Las innovaciones centrales detrás de Audio Flamingo 3
- AF-Whisper: un codificador de audio unificado AF3 usa AF-Whisper, un codificador novedoso adaptado de Whisper-V3. Procesa el habla, los sonidos ambientales y la música utilizando la misma arquitectura, lo que resuelve una limitación importante de los lalmos anteriores que utilizaban codificadores separados, lo que lleva a inconsistencias. AF-Whisper aprovecha los conjuntos de datos de aplicación de audio, metadatos sintetizados y un denso espacio de incrustación de 1280 dimensiones para alinearse con las representaciones de texto.
- Cadena de pensamiento para el audio: razonamiento a pedido A diferencia de los sistemas de control de calidad estáticos, AF3 está equipado con capacidades de “pensamiento”. Utilizando el conjunto de datos AF-pensamiento (250k ejemplos), el modelo puede realizar un razonamiento de la cadena de pensamiento cuando se le solicite, lo que le permite explicar sus pasos de inferencia antes de llegar a una respuesta, un paso clave hacia la IA de audio transparente.
- Conversaciones de múltiples vueltas y múltiples de audio A través del conjunto de datos AF-CHAT (75K Diálogos), AF3 puede mantener conversaciones contextuales que involucran múltiples entradas de audio en las vueltas. Esto imita las interacciones del mundo real, donde los humanos se refieren a señales de audio anteriores. También presenta conversaciones de voz a voz utilizando un módulo de texto a voz de transmisión.
- Razonamiento de audio largo AF3 es el primer modelo completamente abierto capaz de razonar sobre las entradas de audio hasta 10 minutos. Entrenado con Longaudio-XL (ejemplos de 1.25m), el modelo admite tareas como resumen de reuniones, comprensión de podcast, detección de sarcasmo y conexión a tierra temporal.
Puntos de referencia de última generación y capacidad del mundo real
AF3 supera los modelos abiertos y cerrados en más de 20 puntos de referencia, que incluyen:
- MMAU (AVG): 73.14% (+2.14% sobre qwen2.5-o)
- Longudiobench: 68.6 (evaluación GPT-4O), superando a Gemini 2.5 Pro
- Librispeech (ASR): 1.57% fue, superando a PHI-4-mm
- Pathoaqa: 91.1% (vs. 89.2% de Qwen2.5-O)
Estas mejoras no son solo marginales; Redefinen lo que se espera de los sistemas de lenguaje de audio. AF3 también introduce la evaluación comparativa en el chat de voz y la generación del habla, logrando la latencia de generación de 5.94 (vs. 14.62s para Qwen2.5) y mejores puntajes de similitud.
La tubería de datos: conjuntos de datos que enseñan razonamiento de audio
Nvidia no solo escala calculadora, repensaron los datos:
- Audioskills-xl: 8M Ejemplos que combinan razonamiento ambiental, musical y del habla.
- Longudio-xl: Cubre un discurso de larga data de audiolibros, podcasts, reuniones.
- AF-pensamiento: Promueve una inferencia corta al estilo de cuna.
- AF-Cat: Diseñado para conversaciones de múltiples turnos y múltiples de audio.
Cada conjunto de datos es completamente abierto, junto con el código de entrenamiento y las recetas, lo que permite la reproducibilidad y la investigación futura.
Código abierto
AF3 no es solo una caída del modelo. Nvidia lanzado:
- Pesas de modelos
- Recetas de entrenamiento
- Código de inferencia
- Cuatro conjuntos de datos abiertos
Esta transparencia hace que AF3 sea el modelo de audio-lengua de última generación de última generación. Abre nuevas direcciones de investigación en razonamiento auditivo, agentes de audio de baja latencia, comprensión musical e interacción multimodal.
Conclusión: Hacia la inteligencia general de audio
Audio Flamingo 3 demuestra que la comprensión profunda de audio no solo es posible sino reproducible y abierto. Al combinar la escala, las nuevas estrategias de capacitación y los datos diversos, Nvidia ofrece un modelo que escucha, comprende y razona de manera que los Lalms anteriores no podían.
Mira el Papel, Codos y Modelo en la cara abrazada. Todo el crédito por esta investigación va a los investigadores de este proyecto.
¿Listo para conectarse con más de 1 millón de desarrolladores/investigadores/investigadores de AI? Vea cómo Nvidia, LG AI Research y las principales compañías de IA aprovechan a MarktechPost para llegar a su público objetivo [Learn More]
Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.