Voicebox - 开源 AI 语音工作室
Voicebox 是一个本地优先的开源 AI 语音工作室,支持克隆任意声音、在 7 个 TTS 引擎和 23 种语言中生成语音、使用全局热键向任意应用听写,并可为 MCP 智能体提供语音输出,是 ElevenLabs 和 WisprFlow 的开源替代品。
社区作者 · Aitroys 管理员
它解决什么问题
Voicebox 是一个本地优先的开源 AI 语音工作室,把 ElevenLabs(语音输出)和 WisprFlow(语音输入)的能力整合到一个应用中,并基于本地大模型实现语音润色和角色人设。
它支持从几秒音频零样本克隆声音,集成 7 种 TTS 引擎(Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro),覆盖 23 种语言;内置 Whisper 语音识别和全局听写热键(macOS 支持自动粘贴到任意输入框);提供 Stories 多轨时间线编辑器、8 种后处理音效(基于 Spotify pedalboard)、无限长度自动分段与交叉淡化;还通过内置 MCP 服务器和 REST API 让 Claude Code、Cursor、Cline 等智能体以你克隆的声音说话。
技术栈采用 Tauri (Rust) + React + FastAPI (Python),支持 macOS、Windows、Linux、Docker。项目以 MIT 许可证开源。配图 1 为 Voicebox 图标,配图 2、3、4 为应用截图。
— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。
安装 / 开始使用
一、前提条件
安装 Bun、Rust、Python 3.11+、Tauri 环境依赖;macOS 上还需 Xcode。
二、安装 just 命令
可执行
brew install just或
cargo install just。运行 just --list 可查看所有命令。
三、快速开始
- 克隆仓库:
git clone https://github.com/jamiepine/voicebox.git- 进入目录:
cd voiceboxjust setup
- 创建 Python 虚拟环境并安装所有依赖:
just dev
- 启动后端和桌面应用:
四、构建本地版本
just build
just build-local
- 构建 CPU 服务端二进制与 Tauri 应用:
- Windows 上构建 CPU + CUDA 服务端二进制与 Tauri 应用:
五、Docker 方式
在项目目录执行
docker compose up。六、Linux 暂无预编译二进制,需按 voicebox.sh/linux-install 从源码构建。
七、首次运行
macOS 上首次使用全局听写时,应用内会引导授予辅助功能和输入监控权限;Windows/Linux 自动粘贴功能在路线图中。
八、常见问题
安装、生成、模型下载和 GPU 问题可参考项目的 Troubleshooting Guide(https://voicebox.sh/docs/troubleshooting 或仓库内文档)。