Voice-Pro:集语音识别、翻译与多语言配音于一体的 Gradio WebUI
Voice-Pro 是 abus-aikorea 开源的一款 AI 语音 Web 应用,把 YouTube 视频下载、人声分离(Demucs)、语音识别(Whisper / Faster-Whisper / Whisper-Timestamped)、100+ 语言翻译(Deep-Translator)与多语言 TTS(Edge-TTS、kokoro、F5-TTS、E2-TTS、CosyVoice)整合进一个 Gradio 界面,面向播客、开发者与多语言内容创作者。
社区作者 · zZz
它解决什么问题
Voice-Pro 是一个基于 Gradio 的 Web 应用,定位为语音识别、翻译和多语言配音的一体化方案,官方称其为 ElevenLabs 的替代方案,面向播客创作者、开发者和多语言内容生产者。
【核心能力】
- 语音识别:Whisper、Faster-Whisper、Whisper-Timestamped;version 4.0 中 ASR 栈为 faster-whisper 1.2.1(large-v3-turbo、distil-large-v3.5)、openai-whisper 20250625、whisper-timestamped 1.15.9;whisperX 已在 4.0 中移除(其依赖锁定阻碍 Gradio 6 升级,已有配置回退到 faster-whisper)。
- 零样本声音克隆:F5-TTS、E2-TTS、CosyVoice(含 Fun-CosyVoice3)。
- 多语言文本转语音:Edge-TTS(100+ 语言、400+ 音色)、kokoro(官方称在 HuggingFace TTS Arena 排名第 2);可选使用用户自有密钥的 Azure TTS。
- YouTube 处理与音频抽取:yt-dlp。
- 即时翻译:Deep-Translator 支持 100+ 语言;可选 Azure Translator(自有密钥)。
- 人声分离:Demucs。
- 自然断句翻译与 TTS:引入 spaCy。
【WebUI 标签页】
- Dubbing Studio Tab:一站式完成 YouTube 下载、降噪、字幕、翻译与 TTS;支持所有 ffmpeg 兼容格式;输出 WAV、FLAC、MP3;100+ 语言字幕与识别;TTS 支持语速、音量、音调控制。
- Whisper Caption Tab:面向字幕,90+ 语言,视频内嵌字幕显示,支持词级高亮与降噪选项。
- Translate Tab:100+ 语言翻译,支持 ASS、SSA、SRT 等字幕文件,支持实时语音识别与翻译。
- Speech Generation Tab:可选 Edge-TTS、F5-TTS、CosyVoice、kokoro,支持名人音色播客与多语言。
【version 4.0 主要变化】
- 安装器从 Miniconda/pip 迁移到 uv,基于提交的 uv.lock 实现快速、可复现安装;所有内容保存在 installer_files/ 内(uv、Python、依赖包)。
- 运行时升级为 Python 3.12、Torch 2.8.0+cu128(支持 RTX 50 系列)、Gradio 6.20。
- TTS 栈:F5-TTS 1.1.21、kokoro 0.9.4、edge-tts 7.x,并重新内置 CosyVoice(上游 main)。
- 新增可选 TTS 模型 Fun-CosyVoice3-0.5B,支持 9 种语言(含韩语),在 CosyVoice 标签页选择,首次使用时从官方 HF 仓库下载。
- 不再需要 CUDA Toolkit 与 Visual Studio Build Tools,依赖均为预编译 wheel,PyTorch 自带 CUDA 运行时。
- 对受限/企业电脑友好:无需管理员权限;未安装 ffmpeg 时 start.bat 自动下载便携版 ffmpeg;Whisper 模型下载在中断或损坏后可自愈;免费 Google 翻译端点被限流时自动退避重试(失败行会报告并保留原文)。
- 错误以红色提示条(toast)形式显示在 WebUI 中,需手动关闭才会消失。
- UI 迁移至 Gradio 6:所有标签页全宽布局,字幕轨直接显示在视频播放器中。
- uninstall.bat 不再需要管理员权限,不再强制重启;uninstall.bat silent 可无人值守运行。
【历史版本要点】
- version 3.2:宣布全部代码开源、完全免费,支持 Windows、Mac、Linux。
- version 3.1:支持 F5-TTS 微调模型(英语/中文 SWivid/F5-TTS_v1、芬兰语、法语、印地语、意大利语、日语、俄语、西班牙语对应社区模型)。
- version 3.0:移除 AI Cover 功能,新增 whisperX 支持。
version 2.0:
Python 3.10.15、Torch 2.5.1+cu124、Gradio 5.14.0;免费试用支持最长 60 秒媒体;新增 AI Cover、CosyVoice 与 kokoro;首次运行下载 CozyVoice2-0.5B(9GB),可能超过 1 小时;新增 spaCy;订阅版包含 Azure Translator 与 TTS,且不限使用时长。
【参考音色】 页面在 Issues 页面收集音色需求,并列出参考音色示例:英语(Andrew Huberman、Elon Musk、Joe Rogan、Sam Altman、Yuval Harari 等)、中文(迪丽热巴、蔡依林、吴亦凡、李易峰、杨幂、赵丽颖等)、韩语(BTS 진/Jin、BTS RM、IU、이병헌、이정재、유재석)、日语(綾瀬はるか)。
【官方注意事项】
- 由于团队投入 WeConnect 开发,Voice-Pro 暂时无法继续开发与更新。
- 全部代码已开源、完全免费,任何人可自由分发与修改(页面未标注具体许可证名称)。
- 在带 NVIDIA GPU 的 Windows 上运行良好;Mac 和 Linux 上的运行尚未验证。
- 故障排查:多数问题可通过删除 installer_files 文件夹后重新运行 start.bat 解决(干净重装只需几分钟,已下载的 model/ 中 AI 模型会保留)。
【配图】 配图 2 为 Dubbing Studio 主界面截图(main_page_crop.eng.jpg),可用于了解 WebUI 布局;配图 11、配图 12 为界面截图(Hotpot 0 / Hotpot 1);配图 3-10 为语言切换用的国旗图标;配图 1 为 Buy Me a Coffee 赞助按钮。
【SaaS 对比】 页面列出 Maestra、Kapwing、VEED.IO、HappyScribe、Sonix、Descript、AppTek、Transkriptor 等 SaaS 平台的字幕/翻译/TTS 能力,并以 60 分钟韩语视频(字幕生成 + 英文翻译 + 英文配音)估算成本(约 $12~$48 不等,AppTek 为定制报价),作为 Voice-Pro 的替代参考;页面注明价格约为 2025 年 4 月 15 日数据,可能变化。
— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。
安装 / 开始使用
以下步骤依据项目 README 的 Installation 章节整理。Windows 使用 .bat 脚本,Mac/Linux 使用 configure.sh 与 start.sh(官方同时说明 Mac/Linux 上的运行尚未验证)。
一、准备环境
- 系统:Windows 10/11(64 位)、Linux、Mac(Apple Silicon)。
- GPU:NVIDIA GPU + 较新驱动(推荐 >= 570;支持 RTX 50 系列)。不需要单独安装 CUDA Toolkit。
- 显存:4GB+(推荐 8GB+);内存:4GB+;存储:20GB+ 可用空间;需要联网。
- version 4.0 起不再需要 CUDA Toolkit 与 Visual Studio Build Tools。
- 若没有管理员权限可跳过 configure 步骤,start.bat 会自动下载便携版 ffmpeg。
二、获取安装包 方式一:克隆仓库
git clone https://github.com/abus-aikorea/voice-pro.git方式二:从 Releases 页面下载最新发行版的 Source code (zip) 并解压。
三、安装与运行
- 运行 configure.bat(可选,Mac/Linux 为 configure.sh)
- 在系统范围内配置 git 与 ffmpeg(不再需要 CUDA Toolkit / Visual Studio)。
- 需要管理员权限,只需运行一次。
- 没有管理员权限可跳过:start.bat 会自动下载便携版 ffmpeg。
- 运行 start.bat(Mac/Linux 为 start.sh)
- 启动 Voice-Pro WebUI。
- 首次运行会下载 uv + Python 3.12,并根据 lockfile 安装全部依赖(耗时以分钟计,而非小时),随后下载 AI 模型(约 10GB,这一步最慢)。
- GPU/CPU 会自动检测;可用 GPU_CHOICE 环境变量覆盖(G = NVIDIA,C = CPU),或删除 installer_files\gpu_choice.txt 后重试。
- 出现问题时,删除 installer_files 文件夹后重试。
- 首次运行
- 启动后浏览器一般会自动打开;如未自动打开,关闭 Windows-Command 窗口重新运行 start.bat,或手动在浏览器地址栏输入命令窗口中显示的地址(例如 http://127.0.0.1:7870)。
四、更新
- 运行 update.bat:将 Python 环境精确重新同步到已提交的 lockfile(速度快)。
五、卸载
- 运行 uninstall.bat 或直接删除文件夹(便携式安装)。
- 不需要管理员权限;加 silent 参数可无人值守卸载:uninstall.bat silent。
- 只会删除 installer_files 文件夹,model/ 与 workspace/ 文件夹会保留。
六、(可选)配置 Azure 服务(.env) 默认使用免费服务:Deep-Translator(Google 免费网页端点)做翻译、Edge-TTS 做语音合成。若自有 Microsoft Azure 订阅,可切换到 Azure API:
Windows:copy .env.example .env
- 在项目根目录将 .env.example 复制为 .env:
Mac/Linux
cp .env.example .env- 填写 Azure 凭据:
Azure Speech Service (TTS)
AZURE_SPEECH_KEY=your_azure_speech_key_hereAZURE_SPEECH_REGION=eastusAzure Translator Service
AZURE_TRANSLATOR_KEY=your_azure_translator_key_hereAZURE_TRANSLATOR_ENDPOINT=https://your-translator-resource.cognitiveservices.azure.com/AZURE_TRANSLATOR_REGION=eastus注意事项:不要把 .env 提交到版本控制,其中包含私钥。适合配置 Azure 的场景:企业/受限网络(安全设备常限流或封锁免费的 translate.google.com,导致长字幕翻译变慢或失败)、需要更高质量/更一致的 TTS 音色与更高频率限制。
- 重启 Voice-Pro。启动时会自动检测有效密钥:翻译切换为 Azure Translator,Speech Generation 标签页第一项变为 Azure-TTS。
七、常见问题与技巧
- 浏览器未自动运行:关闭 Windows-Command 窗口后重新运行 start.bat;或手动打开浏览器并输入命令窗口中显示的地址(例如 http://127.0.0.1:7870)。
- CUDA Out-Of-Memory:在 Windows 任务管理器-性能标签查看显存占用;将 Denoise 级别设为 0 或 1(级别 2 需要至少 8GB 显存);将 Compute Type 设为 int 类型(float 质量更好但更耗显存)。
- 提升字幕质量:通常 Whisper 模型越大效果越好,但不绝对(large > medium > small > base > tiny);Compute Type 中 float 性能好,int 通过量化降低显存占用并提速但性能下降;提高降噪级别会移除更多背景音、只用剩余人声识别,但不保证结果更好。
- 通用故障排查:多数问题可通过删除 installer_files 文件夹后重新运行 start.bat 解决(干净重装只需几分钟,已下载的模型保留在 model/);错误会以红色 toast 显示在 WebUI 中,需手动关闭。






