Voice-Pro

IA / ML

De un vídeo de YouTube a voz clonada y doblaje en más de 100 idiomas, en local y sin API de pago.

Descripción

Cuando un podcaster, un creador de audiolibros o un equipo de localización necesita pasar de un vídeo o un archivo de audio a subtítulos, traducción y voz clonada, puede encadenar el flujo en el propio equipo: descarga con yt-dlp, aislamiento vocal con Demucs, transcripción y síntesis, sin depender de un servicio en la nube.

Reconocimiento, clonación y síntesis en la misma interfaz

La WebUI Gradio agrupa reconocimiento con Whisper, Faster-Whisper y Whisper-Timestamped; clonación a cero disparos con F5-TTS, E2-TTS y CosyVoice (incluido Fun-CosyVoice3); y texto a voz con Edge-TTS y kokoro. La traducción cubre más de 100 idiomas con Deep-Translator; Azure TTS y Azure Translator son opcionales si se usan claves propias.

  • Procesado de YouTube y extracción de audio con yt-dlp
  • Aislamiento de voces con Demucs
  • Pensado para Windows con GPU NVIDIA; Mac y Linux no están verificados

El repositorio es de código abierto bajo GPL-3.0 y se distribuye de forma gratuita. La versión 4 migra el instalador a uv, con Python 3.12 y Torch 2.8 (incluye RTX de la serie 50). El desarrollo está temporalmente detenido por el trabajo en WeConnect, pero el código permanece libre para usarlo y modificarlo.

Tecnologías y temas

  • Clonación de voz

    Cero disparos con F5-TTS, E2-TTS y CosyVoice

  • Demucs

    Aislamiento de voces antes de transcribir o clonar

  • Doblaje

    Traducción a más de 100 idiomas y síntesis posterior

  • TTS

    Edge-TTS, kokoro y Azure opcional con claves propias

  • Whisper

    Transcripción con Faster-Whisper y Whisper-Timestamped

  • yt-dlp

    Descarga de YouTube y extracción de audio