返回目录
开源项目文档办公类新手

Vibe - 本地离线音视频转写工具(Transcribe on your own!)

Vibe 是一款在本地设备上完成音频与视频转写的开源应用,主打完全离线、隐私优先的转写体验。它支持几乎全部语言,可转写本地音视频、麦克风、系统声音,也能从 YouTube、Vimeo、Facebook、Twitter 等网站提取音频转写;支持批量处理、实时预览、说话人分离以及 SRT、VTT、TXT、HTML、PDF、JSON、DOCX 等输出格式,并提供 CLI 与 HTTP API。

0 次阅读2026/09/14 发布
Vibe - 本地离线音视频转写工具(Transcribe on your own!) 来源图片

社区作者 · zZz

它解决什么问题

Vibe 的定位是“Transcribe on your own!”——把音频和视频直接在自己的设备上转写成文字。项目封面与界面预览可参考配图 1(Vibe logo)与配图 2(应用界面预览,浅色主题)。

核心特性(均来自项目 README 的能力清单):

  • 语言覆盖:可转写几乎每一种语言。
  • 隐私与离线:完全离线转写,数据不会离开你的设备,README 称其为“Ultimate privacy”。
  • 界面:用户友好的设计。
  • 输入来源:音频/视频文件、系统音频、麦克风,以及从 YouTube、Vimeo、Facebook、Twitter 等流行网站提取音频转写。
  • 批量:支持一次批量转写多个文件。
  • 输出格式:SRT、VTT、TXT、HTML、PDF、JSON、DOCX。
  • 实时预览:转写过程中可实时预览。
  • 模型支持:支持 Whisper、Nemotron 3.5 和 Parakeet TDT v3 模型。
  • 摘要与分析:可通过 Claude API 生成快速的多语言摘要;支持 Ollama,用本地 AI 做分析与批量摘要。
  • 翻译:可从任意语言翻译为英文。
  • 打印:可将转写稿直接打印到任意打印机。
  • 更新与性能:自动更新;针对 GPU 优化(macOS、Windows、Linux),并针对 Nvidia / AMD / Intel GPU 优化(Vulkan / CoreML)。
  • 模型自由度:可在设置中轻松自定义模型,并为高级用户提供模型参数(Model arguments)。
  • 时间戳与字幕:提供 Stable timestamps 模式,面向字幕/影视级时间轴(由 VAD 支撑,速度较慢);可选择针对视频/短视频(reels)优化的字幕长度。
  • 说话人分离:支持 speaker diarization。
  • 手机录音:扫描一次二维码后,由电脑完成转写并把文本回传,iOS 与 Android 均可用,无需从应用商店安装任何东西。
  • 自定义模型集成:可通过 vibe://download/?url=<model url> 集成来自自有站点的模型。
  • 命令行与接口:支持 CLI(见 --help),并提供带 Swagger 文档与 agent skills 的 HTTP API。

支持平台:macOS、Windows、Linux。

社区与协作:欢迎提交 PR,也欢迎贡献翻译(README 提供翻译指南)。项目路线图见 Vibe-Roadmap,文档见 Vibe Docs,更多介绍见 Medium post;提交问题(Issue)前建议先查看 DEBUG.md。README 同时给出隐私政策入口。

致谢:项目致谢 tauri.app(应用框架)、github.com/whisper.cpp(AI 模型接口)、openai.com(Whisper 模型)以及 GitHub 为开源项目免费提供基础设施。

— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。

安装 / 开始使用

来源 README 未给出逐条安装命令,仅给出下载入口与若干使用/排障线索,以下为可确证的信息,未提及部分标注待核验:

  1. 获取与安装应用
  • README 顶部提供“Download Vibe”链接作为官方下载入口,属于预编译应用的分发方式;具体下载地址、安装包类型(dmg/exe/AppImage 等)与安装步骤待核验。
  • 支持平台为 macOS、Windows、Linux。README 提到“自动更新”,说明应用具备自动更新机制。
  1. 首次运行与基本使用
  • 启动后可在设置(Settings)中自定义模型,README 强调“Total Freedom: Customize Models Easily via Settings”,高级用户还可配置模型参数。
  • 转写来源可选:本地音频/视频文件、系统音频、麦克风,或从 YouTube、Vimeo、Facebook、Twitter 等网站提取音频。
  • 可开启 Realtime preview 实时查看转写过程;可对多个文件进行批量转写。
  • 输出可选择 SRT、VTT、TXT、HTML、PDF、JSON、DOCX 等格式。
  1. 命令行(CLI)
  • README 说明支持 CLI,并提示查看 --help 获取用法;具体命令名称与参数清单来源未列出,待核验。
  1. HTTP API
  • 项目提供 HTTP API,并附带 Swagger 文档与 agent skills;接口地址、启动方式与鉴权方式来源未给出,待核验。
  1. 自定义模型安装
  • 可通过 URL scheme 集成自有站点的模型:vibe://download/?url=<model url>。
  1. 手机端配合
  • 手机录音流程为:扫描一次二维码,随后由电脑执行转写并把文本回传;iOS 与 Android 均可使用,且无需从应用商店安装应用。
  1. 本地开发(面向开发者)
  • README 提供“Get started with local development here.”的本地开发指南链接,具体依赖、构建命令与顺序待核验。
  • 欢迎提交 PR,也欢迎补充翻译(见翻译指南)。
  1. 常见问题与排障
  • 提交 Issue 前建议先查看 DEBUG.md(README 明确推荐)。
  • 其余常见问题(模型下载失败、GPU 加速异常、字幕时间轴不准等)在来源正文中未展开,待核验。
  1. 涉及隐私
  • 转写为完全离线,数据不离开设备;但使用 Claude API 做摘要、从 YouTube 等网站在线提取音频时会产生网络请求,README 提供 Privacy Policy 链接供查阅。

来源教程配图

Vibe logo
配图 1 · Vibe logo查看原图
教程配图
配图 2 · 教程配图查看原图

适用场景

将本地音频
视频文件离线转写为文字稿
保证内容不出本机
为视频/影视内容生成 SRT
VTT 字幕
并使用 Stable timestamps 模式优化时间轴
批量转写多个录音或视频文件
形成 TXT
DOCX
PDF
JSON
HTML 等交付格式