返回目录
开源项目AI 音频与语音类新手

Voicebox - 开源 AI 语音工作室

Voicebox 是一个本地优先的开源 AI 语音工作室,支持克隆任意声音、在 7 个 TTS 引擎和 23 种语言中生成语音、使用全局热键向任意应用听写,并可为 MCP 智能体提供语音输出,是 ElevenLabs 和 WisprFlow 的开源替代品。

1 次阅读2026/08/11 发布
Voicebox - 开源 AI 语音工作室 来源图片

社区作者 · Aitroys 管理员

它解决什么问题

Voicebox 是一个本地优先的开源 AI 语音工作室,把 ElevenLabs(语音输出)和 WisprFlow(语音输入)的能力整合到一个应用中,并基于本地大模型实现语音润色和角色人设。

它支持从几秒音频零样本克隆声音,集成 7 种 TTS 引擎(Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA、Kokoro),覆盖 23 种语言;内置 Whisper 语音识别和全局听写热键(macOS 支持自动粘贴到任意输入框);提供 Stories 多轨时间线编辑器、8 种后处理音效(基于 Spotify pedalboard)、无限长度自动分段与交叉淡化;还通过内置 MCP 服务器和 REST API 让 Claude Code、Cursor、Cline 等智能体以你克隆的声音说话。

技术栈采用 Tauri (Rust) + React + FastAPI (Python),支持 macOS、Windows、Linux、Docker。项目以 MIT 许可证开源。配图 1 为 Voicebox 图标,配图 2、3、4 为应用截图。

— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。

安装 / 开始使用

一、前提条件

安装 Bun、Rust、Python 3.11+、Tauri 环境依赖;macOS 上还需 Xcode。

二、安装 just 命令

可执行

可复制命令
brew install just

可复制命令
cargo install just

。运行 just --list 可查看所有命令。

三、快速开始

  1. 克隆仓库:
命令
git clone https://github.com/jamiepine/voicebox.git
  1. 进入目录:
命令
cd voicebox

just setup

  1. 创建 Python 虚拟环境并安装所有依赖:

just dev

  1. 启动后端和桌面应用:

四、构建本地版本

just build

just build-local

  • 构建 CPU 服务端二进制与 Tauri 应用:
  • Windows 上构建 CPU + CUDA 服务端二进制与 Tauri 应用:

五、Docker 方式

在项目目录执行

可复制命令
docker compose up

。六、Linux 暂无预编译二进制,需按 voicebox.sh/linux-install 从源码构建。

七、首次运行

macOS 上首次使用全局听写时,应用内会引导授予辅助功能和输入监控权限;Windows/Linux 自动粘贴功能在路线图中。

八、常见问题

安装、生成、模型下载和 GPU 问题可参考项目的 Troubleshooting Guide(https://voicebox.sh/docs/troubleshooting 或仓库内文档)。

来源教程配图

Voicebox
配图 1 · Voicebox查看原图
Voicebox App Screenshot
配图 2 · Voicebox App Screenshot查看原图
Voicebox Screenshot 2
配图 3 · Voicebox Screenshot 2查看原图
Voicebox Screenshot 3
配图 4 · Voicebox Screenshot 3查看原图

适用场景

从几秒音频零样本克隆声音并生成 23 种语言的语音
使用全局热键在任意应用中听写
macOS 自动粘贴到当前输入框
为 MCP 智能体(Claude Code
Cursor
Cline 等)提供语音输出
让智能体用克隆的声音说话
播客
小说
对话等长音频生成
支持多轨 Stories 编辑器和效果链
游戏对话