OmniVoice Studio: cómo utilizarlo
01 / 08
¿Qué es OmniVoice Studio?
OmniVoice Studio es una aplicación de escritorio de código abierto para clonación de voz, doblaje de vídeo, dictado en tiempo real y registro de oradores. Todo se ejecuta localmente en su máquina. Sin claves API, sin cuenta en la nube, no se requiere suscripción.
646 idiomas admitidos para TTS a través del motor OmniVoice predeterminado 99 idiomas para transcripción a través de WhisperX Disponible en macOS, Windows y Linux La GPU es opcional: todo el proceso se ejecuta en la CPU Gratis para uso personal, educativo y de investigación (FSL-1.1-ALv2)
OmniVoice Studio: cómo utilizarlo
02 / 08
Requisitos del sistema
Una GPU es opcional. Sin uno, TTS se ejecuta aproximadamente 3 veces más lento en la CPU. Con ≤8 GB de VRAM, TTS se descarga automáticamente a la CPU durante la transcripción, sin necesidad de configuración.
ComponenteMínimoSO recomendadoWin 10 / macOS 12+ / Ubuntu 20.04+Cualquier sistema operativo moderno de 64 bits RAM8 GB16 GB+ VRAM4 GB (descargas automáticas)8 GB+ (RTX 3060+) Disco10 GB libres20 GB+ SSD Python3.10+3.11–3.12 GPUOpcionalCUDA / MPS / ROCm
OmniVoice Studio: cómo utilizarlo
03 / 08
Instalación
El proyecto recomienda ejecutar desde la fuente. Primero instale tres requisitos previos: ffmpeg, Bun (tiempo de ejecución de JS) y uv (administrador de paquetes de Python).
git clone https://github.com/debpalash/OmniVoice-Studio.git cd OmniVoice-Studio uv sync bun install bun dev
La interfaz se carga en http://localhost:5173 | La API se ejecuta en el puerto 8000.
Los pesos de los modelos se descargan automáticamente en la primera generación.
Instaladores prediseñados disponibles: macOS DMG, Windows MSI, Linux AppImage y .deb; consulte la página de Lanzamientos en GitHub.
OmniVoice Studio: cómo utilizarlo
04 / 08
Clonación de voz
La clonación de voz utiliza el aprendizaje de disparo cero: clona una voz a partir de un clip de tan solo 3 segundos, sin entrenamiento previo sobre esa voz. El motor OmniVoice predeterminado condiciona un modelo TTS basado en difusión en el audio de referencia.
Vaya a la pestaña Clonar voz en la interfaz de usuario Cargue o grabe un clip de audio de 3 segundos de la voz de destino Ingrese su texto y seleccione un idioma de destino (646 disponibles) Haga clic en Generar: la salida se guarda en la biblioteca de su proyecto
Galería de voz: busque en YouTube, explore categorías y descargue clips de referencia directamente dentro de la aplicación para crear su biblioteca de voz.
OmniVoice Studio: cómo utilizarlo
05 / 08
Doblaje de vídeo
El proceso de doblaje completo se ejecuta localmente: transcribir → traducir → sintetizar → mux. Demucs aísla las voces para que el audio de fondo original se conserve en la exportación final.
Vaya a la pestaña Dub: pegue una URL de YouTube o cargue un archivo local. WhisperX transcribe la voz con alineación a nivel de palabra. Seleccione un idioma de destino; la traducción se ejecuta automáticamente El motor TTS vuelve a expresar la transcripción; Demucs conserva el audio de fondo Exporta el MP4 final con audio doblado mezclado
Cola por lotes: suelte hasta 50 vídeos y aléjese. Cada trabajo tiene su propia barra de progreso que rastrea todo el proceso.
OmniVoice Studio: cómo utilizarlo
06 / 08
Dictado y Diarización del Orador
El dictado funciona en todo el sistema desde cualquier aplicación. La diarización identifica hablantes individuales en un archivo de audio de varios hablantes usando Pyannote + WhisperX.
Presione ⌘+⇧+Espacio (macOS) para abrir el widget de dictado flotante. La voz se transmite a través de WebSocket y se pega automáticamente en el campo de entrada activo. Cargue un archivo de varios hablantes en la pestaña Diarización. Pyannote identifica quién dijo qué; cada orador obtiene un perfil de voz extraído automáticamente. Asigne una voz TTS por orador para el doblaje por orador.
Se requiere el token Hugging Face para la diarioización de Pyannote. Consulte docs/setup/huggingface-token.md en el repositorio.
OmniVoice Studio: cómo utilizarlo
07 / 08
Motores TTS
Hay seis motores TTS integrados. Cambie a través de Configuración → Motor TTS o la var env:
OMNIVOICE_TTS_BACKEND=voz acogedora
MotorIdiomasClonePlatform OmniVoice (predeterminado)600+ ✓CUDA / MPS / CPU CosyVoice 39 + 18 dialectos ✓CUDA / MPS / CPU MLX-AudioMultiVaries Solo Apple Silicon VoxCPM230 ✓CUDA / MPS / CPU MOSS-TTS-Nano20 ✓CUDA / CPU KittenTTSInglés✗Solo CPU
Motor personalizado: subclase TTSBackend en backend/services/tts_backend.py y agréguelo a _REGISTRY. ~50 líneas de Python.
OmniVoice Studio: cómo utilizarlo
08 / 08
Servidor MCP y recursos
OmniVoice Studio incluye un servidor MCP integrado, que expone capacidades de voz y doblaje a cualquier cliente compatible con MCP (Claude, Cursor o sus propias herramientas) sin abrir la interfaz de usuario del escritorio.
El servidor MCP se inicia junto con el backend FastAPI en bun dev. Apunte su cliente MCP al servidor local para acceder a todos los puntos finales. AudioSeal (Meta) incorpora una marca de agua neuronal invisible en todo el audio generado para la procedencia de IA GitHub: github.com/debpalash/OmniVoice-Studio Documentos de instalación: docs/install/ (macos/windows/linux/docker) Solución de problemas: docs/install/troubleshooting.md Discord: discord.gg/bzQavDfVV9