OPEN-SOURCE TOOLS
真正有实用价值的 GitHub 开源工具 按股票分析、量化交易、数字货币、视频增强和图片增强等方向筛选实用开源项目。
开源工具 Skills 开源模型 游戏模型 3D
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
VoiceStudio:完全本地的开源语音克隆与工作流引擎(ElevenLabs 开源替代) VoiceStudio 是一个开源、完全本地运行的语音克隆与音频工作流引擎,定位为 ElevenLabs 的开源替代方案,提供语音克隆、语音设计、视频配音、听写、转写与有声书制作能力,并内置本地 API 与 MCP 供智能体调用。默认引擎为 k2-fsa/OmniVoice,也可选择其他引擎;桌面端主推 Electron 应用(0.5.3 引入,同时是最后一个 Tauri 版本)。许可证为 AGPL-3.0,模型各自遵循自身许可证。
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
Paseo:用一套界面在桌面与手机上编排多个编程 Agent Paseo 是 Apache-2.0 许可的开源多智能体编排工具,通过桌面端、移动端、Web 与 CLI 统一调用 Claude Code、Codex、GitHub Copilot、OpenCode、Pi 等编程 Agent。它在本机运行名为 daemon 的本地服务,Agent 在用户自己的开发环境中并行执行,支持语音控制、跨设备接管、端到端加密中继配对,并提供 TypeScript SDK、插件系统与 Skills 编排命令,无遥测、无跟踪、无强制登录。
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
AgenticSeek:完全本地的 Manus AI 替代方案,可自主浏览网页、写代码、规划并执行复杂任务 AgenticSeek 是一个 100% 本地运行的语音启用 AI 助手,被定位为 Manus AI 的开源本地替代品。它自带浏览器自主上网搜索、读取与填表能力,可自主编写/调试/运行 Python、C、Go、Java 等程序,能把复杂任务拆解为由多个 AI Agent 分步执行,并默认搭配本地推理模型(Ollama、LM Studio、兼容 OpenAI 接口的本地服务)实现零云端依赖与数据不出本机。
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
GitHub - k2-fsa/sherpa-onnx: Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next- Supported functions Speech recognition Speech synthesis Source separation ✔️ ✔️ ✔️ Speaker identification Speaker diarization Speaker verification ✔️ ✔️ ✔️ Spoken Language identification Audio tagging Voice activity detection ✔️ ✔️ ✔️ Keyword spotting Add
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
GitHub - OpenMOSS/MOSS: An open-source, tool-augmented conversational language model from Fudan University MOSS [ 论文 ][ 中文版 ] [ English ] [ 官方微信群 ] MOSS 是支持中英双语对话与工具调用的开源语言模型。本仓库提供 MOSS-003 系列模型、对话数据、部署与微调代码。 从这里开始: 模型下载 · 硬件要求 · 本地运行 · 微调 查看 OpenMOSS 的更多项目: MOSS-TTS · MOSS-VL · MOVA · OpenMOSS . 目录 - 开源清单 - 模型 - 数据 - 工程方案 - 介绍 - 本地部署 - 硬件要求 - 下载安装 - 使用示例 - 微调 -
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
Fay 数字人框架:连接数字人与大语言模型业务系统的 Agent 框架 Fay 是 xszyou 开源的数字人 Agent 框架,向上适配 2.5D/3D/移动端/PC/网页等各类数字人模型技术,向下接入 OpenAI 兼容接口、DeepSeek 等大语言模型,并可自由更换 TTS、ASR 模型,为单片机、App、网站、大屏及三方业务系统提供数字人交互接口,支持全离线、全时流式、多用户多路并发、MCP 工具管理与主动播报。
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
ChatTTS:面向日常对话场景的生成式语音模型 ChatTTS 是 2noise 开源的文本转语音(TTS)模型,专为 LLM 助手等对话场景设计,支持英文与中文(其他语言标注为即将支持)。其特点包括对话式 TTS、多说话人、对笑声/停顿/插话等韵律特征的细粒度控制。代码以 AGPLv3+ 发布,模型权重以 CC BY-NC 4.0 发布,仅限教育与研究用途。
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
GitHub - idootop/mi-gpt: 🏠 将小爱音箱接入 ChatGPT 和豆包,改造成你的专属语音助手。 Warning 本项目已停止维护,不再提供更新与支持,感谢大家的使用。 MiGPT:智能家居,从未如此贴心 ❤️ 👉 演示视频: 将小爱音箱接入 ChatGPT 和豆包,改造成你的专属语音助手~ mi-gpt-demo1.mp4 👋 项目简介 在这个数字化的世界里,家已不仅仅是一个居住的地方,而是我们数字生活的延伸。 MiGPT 通过将小爱音箱、米家智能设备,与 ChatGPT 的理解能力完美融合,让你的智能家居更懂你。 MiGPT 不仅仅是关于设备自动化,而是关于: 打造一个懂你、有温度、与你共同进化的家
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
Voice-Pro:集语音识别、翻译与多语言配音于一体的 Gradio WebUI Voice-Pro 是 abus-aikorea 开源的一款 AI 语音 Web 应用,把 YouTube 视频下载、人声分离(Demucs)、语音识别(Whisper / Faster-Whisper / Whisper-Timestamped)、100+ 语言翻译(Deep-Translator)与多语言 TTS(Edge-TTS、kokoro、F5-TTS、E2-TTS、CosyVoice)整合进一个 Gradio 界面,面向播客、开发者与多语言内容创作者。
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
GitHub - microsoft/VibeVoice: Open-Source Frontier Voice AI 🎙️ VibeVoice: Open-Source Frontier Voice AI 📰 News 2026-09-03: 🚀 We released VibeVoice-ASR-Streaming , a unified streaming ASR model that continuously transcribes ''who said what'' as speech arrives, with support for customized hotwords and 10 languages. [
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
GitHub - nari-labs/dia: A TTS model capable of generating ultra-realistic dialogue in one pass. Dia is a 1.6B parameter text to speech model created by Nari Labs. UPDATE 🤗(06/27) : Dia is now available through Hugging Face Transformers ! UPDATE 🚀(11/19) : Dia2 is released on Github and HuggingFace link ! Dia directly generates highly realistic
GitHub 开源项目
查看指南
开源项目 · AI 音频与语音类 开源项目 · AI 音频与语音类 · 新手
Bark:Suno 开源的文本提示生成式音频模型 Bark 是 Suno 开发的基于 Transformer 的文本转音频开源模型,可生成高度逼真的多语言语音,也能生成音乐、背景噪声和简单音效,并支持笑声、叹气、哭泣等非语言发声。项目以 MIT 许可证开放预训练检查点,支持商业使用,提供 Python、命令行与 Hugging Face Transformers 三种使用方式。
GitHub 开源项目
查看指南 第 1 / 3 页 · 共 26 条