返回目录
开源项目AI 音频与语音类新手

Voice-Pro:集语音识别、翻译与多语言配音于一体的 Gradio WebUI

Voice-Pro 是 abus-aikorea 开源的一款 AI 语音 Web 应用,把 YouTube 视频下载、人声分离(Demucs)、语音识别(Whisper / Faster-Whisper / Whisper-Timestamped)、100+ 语言翻译(Deep-Translator)与多语言 TTS(Edge-TTS、kokoro、F5-TTS、E2-TTS、CosyVoice)整合进一个 Gradio 界面,面向播客、开发者与多语言内容创作者。

0 次阅读2026/09/16 发布
Voice-Pro:集语音识别、翻译与多语言配音于一体的 Gradio WebUI 来源图片

社区作者 · zZz

它解决什么问题

Voice-Pro 是一个基于 Gradio 的 Web 应用,定位为语音识别、翻译和多语言配音的一体化方案,官方称其为 ElevenLabs 的替代方案,面向播客创作者、开发者和多语言内容生产者。

【核心能力】

  • 语音识别:Whisper、Faster-Whisper、Whisper-Timestamped;version 4.0 中 ASR 栈为 faster-whisper 1.2.1(large-v3-turbo、distil-large-v3.5)、openai-whisper 20250625、whisper-timestamped 1.15.9;whisperX 已在 4.0 中移除(其依赖锁定阻碍 Gradio 6 升级,已有配置回退到 faster-whisper)。
  • 零样本声音克隆:F5-TTS、E2-TTS、CosyVoice(含 Fun-CosyVoice3)。
  • 多语言文本转语音:Edge-TTS(100+ 语言、400+ 音色)、kokoro(官方称在 HuggingFace TTS Arena 排名第 2);可选使用用户自有密钥的 Azure TTS。
  • YouTube 处理与音频抽取:yt-dlp。
  • 即时翻译:Deep-Translator 支持 100+ 语言;可选 Azure Translator(自有密钥)。
  • 人声分离:Demucs。
  • 自然断句翻译与 TTS:引入 spaCy。

【WebUI 标签页】

  • Dubbing Studio Tab:一站式完成 YouTube 下载、降噪、字幕、翻译与 TTS;支持所有 ffmpeg 兼容格式;输出 WAV、FLAC、MP3;100+ 语言字幕与识别;TTS 支持语速、音量、音调控制。
  • Whisper Caption Tab:面向字幕,90+ 语言,视频内嵌字幕显示,支持词级高亮与降噪选项。
  • Translate Tab:100+ 语言翻译,支持 ASS、SSA、SRT 等字幕文件,支持实时语音识别与翻译。
  • Speech Generation Tab:可选 Edge-TTS、F5-TTS、CosyVoice、kokoro,支持名人音色播客与多语言。

【version 4.0 主要变化】

  • 安装器从 Miniconda/pip 迁移到 uv,基于提交的 uv.lock 实现快速、可复现安装;所有内容保存在 installer_files/ 内(uv、Python、依赖包)。
  • 运行时升级为 Python 3.12、Torch 2.8.0+cu128(支持 RTX 50 系列)、Gradio 6.20。
  • TTS 栈:F5-TTS 1.1.21、kokoro 0.9.4、edge-tts 7.x,并重新内置 CosyVoice(上游 main)。
  • 新增可选 TTS 模型 Fun-CosyVoice3-0.5B,支持 9 种语言(含韩语),在 CosyVoice 标签页选择,首次使用时从官方 HF 仓库下载。
  • 不再需要 CUDA Toolkit 与 Visual Studio Build Tools,依赖均为预编译 wheel,PyTorch 自带 CUDA 运行时。
  • 对受限/企业电脑友好:无需管理员权限;未安装 ffmpeg 时 start.bat 自动下载便携版 ffmpeg;Whisper 模型下载在中断或损坏后可自愈;免费 Google 翻译端点被限流时自动退避重试(失败行会报告并保留原文)。
  • 错误以红色提示条(toast)形式显示在 WebUI 中,需手动关闭才会消失。
  • UI 迁移至 Gradio 6:所有标签页全宽布局,字幕轨直接显示在视频播放器中。
  • uninstall.bat 不再需要管理员权限,不再强制重启;uninstall.bat silent 可无人值守运行。

【历史版本要点】

  • version 3.2:宣布全部代码开源、完全免费,支持 Windows、Mac、Linux。
  • version 3.1:支持 F5-TTS 微调模型(英语/中文 SWivid/F5-TTS_v1、芬兰语、法语、印地语、意大利语、日语、俄语、西班牙语对应社区模型)。
  • version 3.0:移除 AI Cover 功能,新增 whisperX 支持。

version 2.0:

可复制命令
Python 3.10.15、Torch 2.5.1+cu124、Gradio 5.14.0

;免费试用支持最长 60 秒媒体;新增 AI Cover、CosyVoice 与 kokoro;首次运行下载 CozyVoice2-0.5B(9GB),可能超过 1 小时;新增 spaCy;订阅版包含 Azure Translator 与 TTS,且不限使用时长。

【参考音色】 页面在 Issues 页面收集音色需求,并列出参考音色示例:英语(Andrew Huberman、Elon Musk、Joe Rogan、Sam Altman、Yuval Harari 等)、中文(迪丽热巴、蔡依林、吴亦凡、李易峰、杨幂、赵丽颖等)、韩语(BTS 진/Jin、BTS RM、IU、이병헌、이정재、유재석)、日语(綾瀬はるか)。

【官方注意事项】

  • 由于团队投入 WeConnect 开发,Voice-Pro 暂时无法继续开发与更新。
  • 全部代码已开源、完全免费,任何人可自由分发与修改(页面未标注具体许可证名称)。
  • 在带 NVIDIA GPU 的 Windows 上运行良好;Mac 和 Linux 上的运行尚未验证。
  • 故障排查:多数问题可通过删除 installer_files 文件夹后重新运行 start.bat 解决(干净重装只需几分钟,已下载的 model/ 中 AI 模型会保留)。

【配图】 配图 2 为 Dubbing Studio 主界面截图(main_page_crop.eng.jpg),可用于了解 WebUI 布局;配图 11、配图 12 为界面截图(Hotpot 0 / Hotpot 1);配图 3-10 为语言切换用的国旗图标;配图 1 为 Buy Me a Coffee 赞助按钮。

【SaaS 对比】 页面列出 Maestra、Kapwing、VEED.IO、HappyScribe、Sonix、Descript、AppTek、Transkriptor 等 SaaS 平台的字幕/翻译/TTS 能力,并以 60 分钟韩语视频(字幕生成 + 英文翻译 + 英文配音)估算成本(约 $12~$48 不等,AppTek 为定制报价),作为 Voice-Pro 的替代参考;页面注明价格约为 2025 年 4 月 15 日数据,可能变化。

— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。

安装 / 开始使用

以下步骤依据项目 README 的 Installation 章节整理。Windows 使用 .bat 脚本,Mac/Linux 使用 configure.sh 与 start.sh(官方同时说明 Mac/Linux 上的运行尚未验证)。

一、准备环境

  • 系统:Windows 10/11(64 位)、Linux、Mac(Apple Silicon)。
  • GPU:NVIDIA GPU + 较新驱动(推荐 >= 570;支持 RTX 50 系列)。不需要单独安装 CUDA Toolkit。
  • 显存:4GB+(推荐 8GB+);内存:4GB+;存储:20GB+ 可用空间;需要联网。
  • version 4.0 起不再需要 CUDA Toolkit 与 Visual Studio Build Tools。
  • 若没有管理员权限可跳过 configure 步骤,start.bat 会自动下载便携版 ffmpeg。

二、获取安装包 方式一:克隆仓库

命令
git clone https://github.com/abus-aikorea/voice-pro.git

方式二:从 Releases 页面下载最新发行版的 Source code (zip) 并解压。

三、安装与运行

  1. 运行 configure.bat(可选,Mac/Linux 为 configure.sh)
  • 在系统范围内配置 git 与 ffmpeg(不再需要 CUDA Toolkit / Visual Studio)。
  • 需要管理员权限,只需运行一次。
  • 没有管理员权限可跳过:start.bat 会自动下载便携版 ffmpeg。
  1. 运行 start.bat(Mac/Linux 为 start.sh)
  • 启动 Voice-Pro WebUI。
  • 首次运行会下载 uv + Python 3.12,并根据 lockfile 安装全部依赖(耗时以分钟计,而非小时),随后下载 AI 模型(约 10GB,这一步最慢)。
  • GPU/CPU 会自动检测;可用 GPU_CHOICE 环境变量覆盖(G = NVIDIA,C = CPU),或删除 installer_files\gpu_choice.txt 后重试。
  • 出现问题时,删除 installer_files 文件夹后重试。
  1. 首次运行
  • 启动后浏览器一般会自动打开;如未自动打开,关闭 Windows-Command 窗口重新运行 start.bat,或手动在浏览器地址栏输入命令窗口中显示的地址(例如 http://127.0.0.1:7870)。

四、更新

  • 运行 update.bat:将 Python 环境精确重新同步到已提交的 lockfile(速度快)。

五、卸载

  • 运行 uninstall.bat 或直接删除文件夹(便携式安装)。
  • 不需要管理员权限;加 silent 参数可无人值守卸载:uninstall.bat silent。
  • 只会删除 installer_files 文件夹,model/ 与 workspace/ 文件夹会保留。

六、(可选)配置 Azure 服务(.env) 默认使用免费服务:Deep-Translator(Google 免费网页端点)做翻译、Edge-TTS 做语音合成。若自有 Microsoft Azure 订阅,可切换到 Azure API:

Windows:copy .env.example .env

  1. 在项目根目录将 .env.example 复制为 .env:

Mac/Linux

Mac/Linux
cp .env.example .env
  1. 填写 Azure 凭据:

Azure Speech Service (TTS)

命令
AZURE_SPEECH_KEY=your_azure_speech_key_here
命令
AZURE_SPEECH_REGION=eastus

Azure Translator Service

命令
AZURE_TRANSLATOR_KEY=your_azure_translator_key_here
命令
AZURE_TRANSLATOR_ENDPOINT=https://your-translator-resource.cognitiveservices.azure.com/
命令
AZURE_TRANSLATOR_REGION=eastus

注意事项:不要把 .env 提交到版本控制,其中包含私钥。适合配置 Azure 的场景:企业/受限网络(安全设备常限流或封锁免费的 translate.google.com,导致长字幕翻译变慢或失败)、需要更高质量/更一致的 TTS 音色与更高频率限制。

  1. 重启 Voice-Pro。启动时会自动检测有效密钥:翻译切换为 Azure Translator,Speech Generation 标签页第一项变为 Azure-TTS。

七、常见问题与技巧

  • 浏览器未自动运行:关闭 Windows-Command 窗口后重新运行 start.bat;或手动打开浏览器并输入命令窗口中显示的地址(例如 http://127.0.0.1:7870)。
  • CUDA Out-Of-Memory:在 Windows 任务管理器-性能标签查看显存占用;将 Denoise 级别设为 0 或 1(级别 2 需要至少 8GB 显存);将 Compute Type 设为 int 类型(float 质量更好但更耗显存)。
  • 提升字幕质量:通常 Whisper 模型越大效果越好,但不绝对(large > medium > small > base > tiny);Compute Type 中 float 性能好,int 通过量化降低显存占用并提速但性能下降;提高降噪级别会移除更多背景音、只用剩余人声识别,但不保证结果更好。
  • 通用故障排查:多数问题可通过删除 installer_files 文件夹后重新运行 start.bat 解决(干净重装只需几分钟,已下载的模型保留在 model/);错误会以红色 toast 显示在 WebUI 中,需手动关闭。

来源教程配图

Buy Me a Coffee
配图 1 · Buy Me a Coffee查看原图
Dubbing Studio
配图 2 · Dubbing Studio查看原图
South Korea Flag
配图 3 · South Korea Flag查看原图
United Kingdom Flag
配图 4 · United Kingdom Flag查看原图
China Flag
配图 5 · China Flag查看原图
Taiwan Flag
配图 6 · Taiwan Flag查看原图
Japan Flag
配图 7 · Japan Flag查看原图
Germany Flag
配图 8 · Germany Flag查看原图

适用场景

为 YouTube 等视频下载音频并抽取音轨
自动生成多语言字幕(ASS/SSA/SRT 等字幕文件翻译)
播客与访谈节目的多语言配音与语音替换
零样本声音克隆(F5-TTS
E2-TTS
CosyVoice)制作名人音色播客
实时语音识别与即时翻译
人声与背景音分离
降噪后再做识别
以本地部署替代 ElevenLabs 等付费 SaaS 字幕/翻译/配音服务
研究者与多语言专业人员的内容本地化