smol-audio: una colección de portátiles compatible con Colab para ajustar Whisper, Parakeet, Voxtral, Granite Speech y Audio Flamingo 3

Audio AI ha tenido un gran año. El reconocimiento automático de voz ha mejorado dramáticamente con modelos como las variantes Whisper de OpenAI, Parakeet de NVIDIA y Voxtral de Mistral. La comprensión del audio avanzó con modelos como Audio Flamingo 3 de NVIDIA. La conversión de texto a voz con calidad de diálogo llegó a través del Dia-1.6B de Nari Labs. Y Meta envió Perception Encoder Audiovisual (PE-AV), un codificador multimodal capaz de aprender un espacio de incrustación compartido a través de audio, video y texto. La frontera nunca se ha movido más rápido.

¿El truco? El conocimiento práctico necesario para trabajar realmente con estos modelos (cómo ajustarlos, adaptarlos a nuevos lenguajes o ejecutar inferencias eficientes) se encuentra disperso en números de GitHub, blogs de investigación y cuadernos privados que nunca ven la luz del día. Si es un ingeniero de aprendizaje automático que solo quiere ajustar Whisper en un nuevo dominio o ejecutar una clasificación de video de toma cero con PE-AV, a menudo comienza desde cero.

Ésa es la brecha que smol-audio está diseñado para cerrar.

¿Qué es smol-audio?

Lanzado bajo la licencia Apache-2.0 por el equipo de Deep-unlearning, smol-audio es un repositorio plano de portátiles Jupyter autónomos, cada uno de los cuales se centra en una única tarea práctica de IA de audio. Cada computadora portátil está diseñada para abrirse directamente en Google Colab, no requiere configuración de GPU local y está construida completamente en el ecosistema de Hugging Face, específicamente transformadores, conjuntos de datos, peft y aceleración. La mayoría de las recetas caben en un tiempo de ejecución de Colab de 16 GB, lo que significa que un nivel de Colab gratuito o estándar es suficiente para la mayoría de las tareas.

El diseño de “repo plano” es una elección deliberada. En lugar de envolver recetas dentro de un marco u ocultar la complejidad detrás de funciones de conveniencia, smol-audio expone cada paso. Puede leer el ciclo de entrenamiento, comprender la canalización de datos y modificar la configuración sin realizar ingeniería inversa en una biblioteca. Para los ingenieros que inician su carrera, esa transparencia es genuinamente educativa.

Ajuste ASR: Whisper, Perakeet, Voxtral y Granite Speech

La categoría más grande del repositorio actual cubre el ajuste de ASR en cuatro familias de modelos distintas. Cada uno requiere un manejo significativamente diferente.

El cuaderno Whisper cubre el ajuste fino mediante transformadores y conjuntos de datos, lo que facilita la adaptación de la arquitectura del codificador-decodificador a un lenguaje personalizado o un dominio limitado. Whisper utiliza un enfoque de secuencia a secuencia, generando transcripciones token por token: territorio familiar para cualquiera que haya trabajado con modelos de lenguaje.

Parakeet de NVIDIA utiliza una arquitectura CTC (clasificación temporal conexionista) en lugar de una configuración de secuencia a secuencia. CTC es más rápido y ligero para la inferencia, pero requiere alineación entre los fotogramas de audio y los tokens de salida en lugar de una decodificación autorregresiva. El portátil de smol-audio cubre tanto el ajuste fino completo como LoRA (adaptación de bajo rango) para Parakeet, lo cual es importante porque el ajuste fino completo de los modelos CTC grandes puede consumir mucha memoria.

Voxtral de Mistral es arquitectónicamente distinto de Whisper y Parakeet. En lugar de un codificador-decodificador ASR tradicional, Voxtral se basa en un modelo de lenguaje de gran tamaño (Ministral 3B para Voxtral Mini y Mistral Small 3.1 24B para Voxtral Small), lo que lo convierte en un modelo de comprensión del habla basado en LLM. El portátil smol-audio maneja el ajuste fino para ASR con enmascaramiento rápido, admitiendo tanto el ajuste fino completo como LoRA. El enmascaramiento de mensajes es importante aquí precisamente debido a esta arquitectura LLM: cuando un modelo acepta mensajes de texto junto con la entrada de audio, normalmente no desea calcular la pérdida en los tokens de mensajes en sí, solo en la transcripción generada. Hacer esto mal conduce a una dinámica de entrenamiento degradada, por lo que tener una implementación de referencia funcional ahorra un tiempo de depuración significativo.

Granite Speech de IBM obtiene su propio portátil centrado en ASR italiano utilizando el conjunto de datos YODAS-Granary. Este es un ejemplo útil más allá del modelo: demuestra el ajuste fino específico del dominio y del idioma en un corpus de habla multilingüe real, un escenario de producción común.

Comprensión de audio con Audio Flamingo 3 de NVIDIA

Audio Flamingo 3, desarrollado por NVIDIA, es un modelo de lenguaje de audio grande (LALM) para el razonamiento y la comprensión del habla, el sonido y la música. El cuaderno smol-audio lo ajusta específicamente para la tarea de subtítulos de audio, generando una descripción en lenguaje natural de un clip de audio, lo cual es útil para herramientas de accesibilidad, indexación de contenido y sistemas de recuperación. El portátil cubre tanto el ajuste fino completo como el ajuste fino basado en LoRA, brindando a los profesionales la opción entre el máximo rendimiento y la eficiencia de la memoria.

LoRA, para aquellos nuevos en el ajuste fino eficiente de parámetros, funciona congelando los pesos del modelo original e inyectando pequeñas matrices de descomposición de rangos entrenables en capas específicas. Para modelos multimodales grandes como Audio Flamingo 3, LoRA puede reducir los requisitos de memoria de la GPU en un orden de magnitud en comparación con el ajuste completo, lo que permite la iteración en hardware básico.

Diálogo TTS con Dia-1.6B

El portátil Dia-1.6B cubre la conversión de texto a voz al estilo diálogo, donde el objetivo no es sólo sintetizar a un solo hablante sino generar intercambios conversacionales naturales. Dia es un modelo TTS de 1.600 millones de parámetros de Nari Labs capaz de producir diálogos entre varios oradores, lo que lo hace relevante para cualquiera que cree agentes de voz, herramientas de generación de podcasts o interfaces conversacionales.

Inferencia multimodal con PE-AV de Meta

Quizás el cuaderno con mayor visión de futuro en la versión actual cubre la inferencia con Perception Encoder Audiovisual (PE-AV) de Meta. PE-AV es un codificador multimodal que aprende un único espacio de incrustación compartido en audio, video y texto, lo que permite la clasificación de video de toma cero sin ningún ajuste fino específico de la tarea y la recuperación de audio↔texto en puntos de referencia como AudioCaps. Debido a que las tres modalidades se asignan al mismo espacio de incrustación, las consultas multimodales, como la recuperación de un clip de audio a partir de una descripción de texto, funcionan mediante una simple similitud de producto punto.

El cuaderno demuestra cómo ejecutar estos canales de inferencia directamente, lo cual es valioso porque los modelos multimodales con codificadores conjuntos de texto audiovisual son arquitectónicamente más complejos que los modelos de modalidad única y generalmente requieren un preprocesamiento cuidadoso de múltiples modalidades de entrada.

Consulte el repositorio aquí. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro SubReddit de más de 130.000 ML y suscribirse a nuestro boletín. ¡Esperar! estas en telegrama? Ahora también puedes unirte a nosotros en Telegram.

¿Necesita asociarse con nosotros para promocionar su repositorio de GitHub O su página principal de Hugging O su lanzamiento de producto O seminario web, etc.? Conéctate con nosotros

Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias de Datos de la Universidad de Padua. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca en transformar conjuntos de datos complejos en conocimientos prácticos.