Microsoft lanzó VibeVoice-1.5B: un modelo de texto a voz de código abierto que puede sintetizar hasta 90 minutos de voz con cuatro altavoces distintos

El último lanzamiento de código abierto de Microsoft, VibeVoice-1.5Bredefine los límites de la tecnología de texto a voz (TTS): audio expresivo, de forma larga, de forma larga, generada por múltiples altavoces que tiene licencia MIT, escalable y altamente flexible para el uso de la investigación. Este modelo no es solo otro motor TTS; Es un marco diseñado para generar hasta 90 minutos de audio ininterrumpido y suena natural, admite una generación simultánea de hasta cuatro altavoces distintos e incluso manejar escenarios de síntesis interlingüísticos y de canto. Con una arquitectura de transmisión y un modelo 7B más grande anunciado para el futuro cercano, VibeVoice-1.5B se posiciona como un gran avance para la investigación de audio, podcasting e voz sintética de audio conversacional con IA.

Características clave

  • Contexto masivo y soporte de múltiples altavoces: VibeVoice-1.5b puede sintetizar hasta 90 minutos de discurso con hasta cuatro altavoces distintos En una sola sesión, superando el típico límite de altavoz 1-2 de los modelos TTS tradicionales.
  • Generación simultánea: El modelo no es solo unir clips de una sola voz; Está diseñado para apoyar transmisiones de audio paralela Para múltiples altavoces, imitando la conversación natural y la toma de turnos.
  • Síntesis de interrogatorio y de canto: Mientras está entrenado principalmente en inglés y chino, el modelo es capaz de síntesis interlingüística e incluso puede generar canto: las características rara vez se demuestran en modelos TTS de código abierto anteriores.
  • Licencia de MIT: Totalmente de código abierto y amigable comercialmente, con un enfoque en la investigación, la transparencia y la reproducibilidad.
  • Escalable para transmisión y audio de forma larga: La arquitectura está diseñada para Síntesis eficiente de larga duración y anticipa un próximo 7b con capacidad de transmisión Modelo, más posibilidades de expansión para TTS en tiempo real y de alta fidelidad.
  • Emoción y expresividad: El modelo se promociona para su control de emociones y expresividad naturalhaciéndolo adecuado para aplicaciones como podcasts o escenarios de conversación.
https://huggingface.co/microsoft/VibeVoice-1.5B

" data-medium-file="https://www.marktechpost.com/wp-content/uploads/2025/08/Fig1-1-300x160.png" data-large-file="https://i0.wp.com/www.marktechpost.com/wp-content/uploads/2025/08/Fig1-1-1024x548.png?ssl=1" fifu-data-src="https://i0.wp.com/www.marktechpost.com/wp-content/uploads/2025/08/Fig1-1-1024x548.png?ssl=1" alt="" class="wp-image-73980 lazyload" style="width:830px;height:auto"/>
https://huggingface.co/microsoft/vibevoice-1.5b

Arquitectura y buceo técnico profundo

La Fundación de VibeVoice es una 1.5B-Parameter LLM (QWEN2.5-1.5B) Eso se integra con dos tokenizadores novedosos:Acústico y Semántico—Manto diseñado para operar en un baja velocidad de cuadro (7.5Hz) para eficiencia computacional y consistencia en secuencias largas.

  • Tokenizador acústico: Una variante σ-Vae con una estructura de codificador de codificador reflejado (cada uno de los parámetros de ~ 340 m), logrando 3200X Discamplio Desde Raw Audio a 24 kHz.
  • Tokenizador semántico: Entrenado a través de un asr apoderado Tarea, esta arquitectura solo codificador refleja el diseño del tokenizador acústico (menos los componentes VAE).
  • Cabeza de decodificador de difusión: Un módulo de difusión condicional liviano (~ 123m) predice características acústicas, aprovechando la guía sin clasificadores (CFG) y el solucionador DPM para la calidad perceptiva.
  • Plan de estudios de longitud de contexto: El entrenamiento comienza en 4K tokens y se escala hasta Tokens de 65k—Nablando el modelo para generar segmentos de audio muy largos y coherentes.
  • Modelado de secuencia: El LLM comprende el flujo de diálogo para la toma de turnos, mientras que el cabezal de difusión genera detalles acústicos de grano fino, separando la semántica y la síntesis al tiempo que preserva la identidad del altavoz durante largas duraciones.

Limitaciones del modelo y uso responsable

  • Solo inglés y chino: El modelo está entrenado únicamente en estos idiomas; Otros idiomas pueden producir salidas ininteligibles u ofensivas.
  • Sin discurso superpuesto: Si bien es compatible no modelar el discurso superpuesto entre los altavoces.
  • Solo discurso: El modelo no genera sonidos de fondo, foley o música—Audio la salida es estrictamente discurso.
  • Riesgos legales y éticos: Microsoft prohíbe explícitamente el uso para suplantación de voz, desinformación o derivación de la autenticación. Los usuarios deben cumplir con las leyes y revelar contenido generado por IA.
  • No para aplicaciones profesionales en tiempo real: Si bien es eficiente, este lanzamiento es no optimizado para escenarios de baja latencia, interactiva o de transmisión en vivo; Ese es el objetivo de la variante 7b que pronto ocupa.

Conclusión

Microsoft’s VibeVoice-1.5B es un avance en TTS abierto: escalable, expresivo y múltiple, con una arquitectura liviana basada en difusión que desbloquea una síntesis de audio conversacional de forma larga para investigadores y desarrolladores de código abierto. Mientras que el uso es actualmente centrado en la investigación y limitadas al inglés/chino, las capacidades del modelo, y la promesa de las próximas versiones, señalan un cambio de paradigma en cómo la IA puede generar e interactuar con el habla sintética.

Para equipos técnicos, creadores de contenido y entusiastas de la IA, VibeVoice-1.5B es una herramienta de exploración imprescindible para la próxima generación de aplicaciones de voz sintética, disponible ahora en abrazar Face y GitHub, con documentación clara y una licencia abierta. A medida que el campo gira hacia TTS más expresivos, interactivos y éticamente transparentes, la última oferta de Microsoft es un punto de referencia para la síntesis de discurso de AI de código abierto.


Preguntas frecuentes

¿Qué hace que VibeVoice-1.5b sea diferente de otros modelos de texto a voz?

VibeVoice-1.5b puede generar hasta 90 minutos de audio expresivo y múltiples (Hasta cuatro altavoces), admite la síntesis interlingüística y de canto, y es de código abierto por completo bajo la licencia del MIT, lo que supera los límites de la generación de audio de IA conversacional de forma larga

Las pruebas comunitarias muestran que la generación de un diálogo de múltiples altavoces con el punto de control de 1.5 B consume ≈ 7 GB de GPU VRAMentonces, una tarjeta de consumo de 8 GB (p. Ej., RTX 3060) es generalmente suficiente para la inferencia.

¿Qué idiomas y estilos de audio admiten el modelo hoy?

VibeVoice-1.5b es entrenado solo en inglés y chino y puede realizar narración interlingüística (por ejemplo, aviso de inglés → discurso chino) así como básico Síntesis de canto. Produce solo el habla, sin sonidos de fondo, y no modela altavoces superpuestos; La toma de turnos es secuencial.


Mira el Informe técnico, Modelo en la cara abrazada y Codos. No dude en ver nuestro Página de Github para tutoriales, códigos y cuadernos. Además, siéntete libre de seguirnos Gorjeo Y no olvides unirte a nuestro Subreddit de 100k+ ml y suscribirse a Nuestro boletín.


Asif Razzaq es el CEO de MarktechPost Media Inc .. Como empresario e ingeniero visionario, ASIF se compromete a aprovechar el potencial de la inteligencia artificial para el bien social. Su esfuerzo más reciente es el lanzamiento de una plataforma de medios de inteligencia artificial, MarktechPost, que se destaca por su cobertura profunda de noticias de aprendizaje automático y de aprendizaje profundo que es técnicamente sólido y fácilmente comprensible por una audiencia amplia. La plataforma cuenta con más de 2 millones de vistas mensuales, ilustrando su popularidad entre el público.