Voice-Pro
De un vídeo de YouTube a voz clonada y doblaje en más de 100 idiomas, en local y sin API de pago.
Descripción
Cuando un podcaster, un creador de audiolibros o un equipo de localización necesita pasar de un vídeo o un archivo de audio a subtítulos, traducción y voz clonada, puede encadenar el flujo en el propio equipo: descarga con yt-dlp, aislamiento vocal con Demucs, transcripción y síntesis, sin depender de un servicio en la nube.
Reconocimiento, clonación y síntesis en la misma interfaz
La WebUI Gradio agrupa reconocimiento con Whisper, Faster-Whisper y Whisper-Timestamped; clonación a cero disparos con F5-TTS, E2-TTS y CosyVoice (incluido Fun-CosyVoice3); y texto a voz con Edge-TTS y kokoro. La traducción cubre más de 100 idiomas con Deep-Translator; Azure TTS y Azure Translator son opcionales si se usan claves propias.
- Procesado de YouTube y extracción de audio con yt-dlp
- Aislamiento de voces con Demucs
- Pensado para Windows con GPU NVIDIA; Mac y Linux no están verificados
El repositorio es de código abierto bajo GPL-3.0 y se distribuye de forma gratuita. La versión 4 migra el instalador a uv, con Python 3.12 y Torch 2.8 (incluye RTX de la serie 50). El desarrollo está temporalmente detenido por el trabajo en WeConnect, pero el código permanece libre para usarlo y modificarlo.
Tecnologías y temas
-
Clonación de voz
Cero disparos con F5-TTS, E2-TTS y CosyVoice
-
Demucs
Aislamiento de voces antes de transcribir o clonar
-
Doblaje
Traducción a más de 100 idiomas y síntesis posterior
-
TTS
Edge-TTS, kokoro y Azure opcional con claves propias
-
Whisper
Transcripción con Faster-Whisper y Whisper-Timestamped
-
yt-dlp
Descarga de YouTube y extracción de audio