Neuphonic ha lanzado Neutts Air, un modelo de lenguaje de habla de texto de código abierto (TTS) diseñado para ejecutarse localmente en tiempo real en CPU. La tarjeta del modelo de abrazadera de abrazos enumera los parámetros de 748m (arquitectura QWEN2) y los barcos en cuantizaciones de GGUF (Q4/Q8), lo que permite la inferencia a través de LLAMA.CPP/LLAMA-CPP-PYTHON sin dependencias de nubes. Tiene licencia bajo Apache-2.0 e incluye una demostración y ejemplos ejecutables.
Entonces, ¿qué hay de nuevo?
Neutts Air combina una columna vertebral QWEN de clase 0.5B con el códec de audio Neucodec de Neuphonic. Neuphonic posiciona el sistema como un TTS LM de “súper realista, en el dispositivo” que cliona una voz de ~ 3 segundos de audio de referencia y sintetiza el habla en ese estilo, apuntando a agentes de voz y aplicaciones sensibles a la privacidad. La tarjeta modelo y el repositorio enfatizan explícitamente la generación de CPU en tiempo real y la implementación de huellas pequeñas.
Características clave
Realismo a escala sub-1b: prosodia de tipo humano y preservación de timbre para un texto a voz de ~ 0.7b (clase QWEN2) LM. Despliegue en el dispositivo: distribuido en GGUF (Q4/Q8) con rutas CPU-First; Adecuado para computadoras portátiles, teléfonos y tablas de clase Raspberry Pi. Clonación de altavoces instantáneos: transferencia de estilo de ~ 3 segundos de audio de referencia (transcripción de referencia WAV +). Pila de códec LM+Compact: esqueleto QWEN 0.5B emparejado con Neucodec (0.8 kbps / 24 kHz) para equilibrar la latencia, la huella y la calidad de salida.
¿Explicar la arquitectura del modelo y la ruta de tiempo de ejecución?
Columna vertebral: qwen 0.5B utilizado como un LM liviano para acondicionar la generación del habla; El artefacto alojado se informa como 748 millones de parámetros bajo la arquitectura QWEN2 en la cara abrazada. Códec: Neucodec proporciona tokenización acústica/decodificación de bajo bitrato; Se dirige a 0,8 kbps con salida de 24 kHz, lo que permite representaciones compactos para un uso eficiente en el dispositivo. Cuantización y formato: están disponibles los retorno de GGUF prebuilt (Q4/Q8); El repositorio incluye instrucciones para Llama-CPP-Python y una ruta de decodificador ONNX opcional. Dependencias: usa espeak para la fonemización; Se proporcionan ejemplos y un cuaderno de Jupyter para la síntesis de extremo a extremo.
Enfoque de rendimiento en el dispositivo
Neutts Air muestra ‘generación en tiempo real en dispositivos de rango medio’ y ofrece valores predeterminados de CPU primero; La cuantización de GGUF está destinada a computadoras portátiles y computadoras de una sola placa. Si bien no se publican números FPS/RTF en la tarjeta, la distribución se dirige a la inferencia local sin una GPU y demuestra un flujo de trabajo a través de los ejemplos y el espacio proporcionados.
🚨 [Recommended Read] VIPE (Video Pose Engine): una herramienta de anotación de video 3D potente y versátil para AI espacial
Flujo de trabajo de clonación de voz
Las neutras requieren (1) un wav de referencia y (2) el texto de transcripción para esa referencia. Codifica la referencia a los tokens de estilo y luego sintetiza texto arbitrario en el timbre del altavoz de referencia. El equipo Neuphonic recomienda 3–15 s limpio y mono audio y proporciona muestras pre-codificadas.
Privacidad, responsabilidad y marca de agua
Neuphonic enmarca el modelo para la privacidad en el dispositivo (sin audio/texto deja la máquina sin la aprobación del usuario) y señala que todo el audio generado incluye un marcador de agua de Perth (umbral perceptual) para respaldar el uso y la procedencia responsables.
¿Cómo se compara?
Existen sistemas TTS locales abiertos (por ejemplo, tuberías basadas en GGUF), pero Neutrys Air es notable por empacar un pequeño códec neural LM + con clonación instantánea, cuantaciones de CPU-primero y marca de agua bajo una licencia permisiva. La primera frase de “la primera fraseo de discurso en el dispositivo” del mundo “es la afirmación del proveedor; Los hechos verificables son el tamaño, los formatos, el procedimiento de clonación, la licencia y los tiempos de ejecución proporcionados.
El enfoque está en las compensaciones del sistema: una columna vertebral de clase QWEN ~ 0.7B con cuantización de Gguf combinada con Neucodec a 0.8 kbps/24 kHz es una receta pragmática para TTS de CPU en tiempo real que preserva el timbre utilizando ~ 3–15 S referencias de estilo mientras mantiene la latencia y la memoria predictiva. La licencia de Apache-2.0 y la marca de agua incorporada son amigables con la implementación, pero publicar RTF/latencia en CPU de productos básicos y curvas de calidad de clonación versus longitud de referencia permitiría una evaluación comparativa rigurosa contra las tuberías locales existentes. Operacionalmente, una ruta fuera de línea con dependencias mínimas (Espeak, Llama.cpp/ONNX) reduce el riesgo de privacidad/cumplimiento de los agentes de borde sin sacrificar la inteligibilidad.
Echa un vistazo a la tarjeta modelo en la cara de abrazo y la página de GitHub. No dude en consultar nuestra página de GitHub para obtener tutoriales, códigos y cuadernos. Además, no dude en seguirnos en Twitter y no olvide unirse a nuestro subreddit de 100k+ ml y suscribirse a nuestro boletín. ¡Esperar! ¿Estás en Telegram? Ahora también puedes unirte a nosotros en Telegram.
Michal Sutter es un profesional de la ciencia de datos con una Maestría en Ciencias en Ciencias de Datos de la Universidad de Padova. Con una base sólida en análisis estadístico, aprendizaje automático e ingeniería de datos, Michal se destaca por transformar conjuntos de datos complejos en ideas procesables.
🔥[Recommended Read] NVIDIA AI Open-Sources Vipe (motor de pose de video): una herramienta de anotación de video 3D potente y versátil para AI espacial