OPEN-SOURCE TOOLS

真正有实用价值的 GitHub 开源工具

按股票分析、量化交易、数字货币、视频增强和图片增强等方向筛选实用开源项目。

正在查看标签 #音频处理清除筛选
GitHub - k2-fsa/sherpa-onnx: Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next- 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

GitHub - k2-fsa/sherpa-onnx: Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-

Supported functions Speech recognition Speech synthesis Source separation ✔️ ✔️ ✔️ Speaker identification Speaker diarization Speaker verification ✔️ ✔️ ✔️ Spoken Language identification Audio tagging Voice activity detection ✔️ ✔️ ✔️ Keyword spotting Add

GitHub 开源项目

0 阅读2026/09/18
查看指南
GitHub - OpenMOSS/MOSS: An open-source, tool-augmented conversational language model from Fudan University 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

GitHub - OpenMOSS/MOSS: An open-source, tool-augmented conversational language model from Fudan University

MOSS [ 论文 ][ 中文版 ] [ English ] [ 官方微信群 ] MOSS 是支持中英双语对话与工具调用的开源语言模型。本仓库提供 MOSS-003 系列模型、对话数据、部署与微调代码。 从这里开始: 模型下载 · 硬件要求 · 本地运行 · 微调 查看 OpenMOSS 的更多项目: MOSS-TTS · MOSS-VL · MOVA · OpenMOSS . 目录 - 开源清单 - 模型 - 数据 - 工程方案 - 介绍 - 本地部署 - 硬件要求 - 下载安装 - 使用示例 - 微调 -

GitHub 开源项目

0 阅读2026/09/18
查看指南
AgenticSeek:完全本地的 Manus AI 替代方案,可自主浏览网页、写代码、规划并执行复杂任务 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

AgenticSeek:完全本地的 Manus AI 替代方案,可自主浏览网页、写代码、规划并执行复杂任务

AgenticSeek 是一个 100% 本地运行的语音启用 AI 助手,被定位为 Manus AI 的开源本地替代品。它自带浏览器自主上网搜索、读取与填表能力,可自主编写/调试/运行 Python、C、Go、Java 等程序,能把复杂任务拆解为由多个 AI Agent 分步执行,并默认搭配本地推理模型(Ollama、LM Studio、兼容 OpenAI 接口的本地服务)实现零云端依赖与数据不出本机。

GitHub 开源项目

0 阅读2026/09/18
查看指南
ChatTTS:面向日常对话场景的生成式语音模型 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

ChatTTS:面向日常对话场景的生成式语音模型

ChatTTS 是 2noise 开源的文本转语音(TTS)模型,专为 LLM 助手等对话场景设计,支持英文与中文(其他语言标注为即将支持)。其特点包括对话式 TTS、多说话人、对笑声/停顿/插话等韵律特征的细粒度控制。代码以 AGPLv3+ 发布,模型权重以 CC BY-NC 4.0 发布,仅限教育与研究用途。

GitHub 开源项目

0 阅读2026/09/17
查看指南
GitHub - idootop/mi-gpt: 🏠 将小爱音箱接入 ChatGPT 和豆包,改造成你的专属语音助手。 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

GitHub - idootop/mi-gpt: 🏠 将小爱音箱接入 ChatGPT 和豆包,改造成你的专属语音助手。

Warning 本项目已停止维护,不再提供更新与支持,感谢大家的使用。 MiGPT:智能家居,从未如此贴心 ❤️ 👉 演示视频: 将小爱音箱接入 ChatGPT 和豆包,改造成你的专属语音助手~ mi-gpt-demo1.mp4 👋 项目简介 在这个数字化的世界里,家已不仅仅是一个居住的地方,而是我们数字生活的延伸。 MiGPT 通过将小爱音箱、米家智能设备,与 ChatGPT 的理解能力完美融合,让你的智能家居更懂你。 MiGPT 不仅仅是关于设备自动化,而是关于: 打造一个懂你、有温度、与你共同进化的家

GitHub 开源项目

0 阅读2026/09/16
查看指南
GitHub - microsoft/VibeVoice: Open-Source Frontier Voice AI 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

GitHub - microsoft/VibeVoice: Open-Source Frontier Voice AI

🎙️ VibeVoice: Open-Source Frontier Voice AI 📰 News 2026-09-03: 🚀 We released VibeVoice-ASR-Streaming , a unified streaming ASR model that continuously transcribes ''who said what'' as speech arrives, with support for customized hotwords and 10 languages. [

GitHub 开源项目

3 阅读2026/09/16
查看指南
GitHub - nari-labs/dia: A TTS model capable of generating ultra-realistic dialogue in one pass. 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

GitHub - nari-labs/dia: A TTS model capable of generating ultra-realistic dialogue in one pass.

Dia is a 1.6B parameter text to speech model created by Nari Labs. UPDATE 🤗(06/27) : Dia is now available through Hugging Face Transformers ! UPDATE 🚀(11/19) : Dia2 is released on Github and HuggingFace link ! Dia directly generates highly realistic

GitHub 开源项目

0 阅读2026/09/16
查看指南
Voice-Pro:集语音识别、翻译与多语言配音于一体的 Gradio WebUI 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

Voice-Pro:集语音识别、翻译与多语言配音于一体的 Gradio WebUI

Voice-Pro 是 abus-aikorea 开源的一款 AI 语音 Web 应用,把 YouTube 视频下载、人声分离(Demucs)、语音识别(Whisper / Faster-Whisper / Whisper-Timestamped)、100+ 语言翻译(Deep-Translator)与多语言 TTS(Edge-TTS、kokoro、F5-TTS、E2-TTS、CosyVoice)整合进一个 Gradio 界面,面向播客、开发者与多语言内容创作者。

GitHub 开源项目

0 阅读2026/09/16
查看指南
NoteGen:本地优先的 Markdown 记录与 AI 整理应用 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

NoteGen:本地优先的 Markdown 记录与 AI 整理应用

NoteGen 是一款本地优先(local-first)的 Markdown 应用,主张“先记录、后整理”:先把灵感、语音、截图、链接、文件、待办等零散信息快速保存,再按标签、时间或类型筛选素材,交给 AI 整理成结构化的 Markdown 笔记。笔记以普通 Markdown 文件保存在用户自选的 workspace 中,可被其它编辑器打开、纳入 Git 或自由迁移;项目同时提供知识库检索、画布、MCP、Skills 与多平台同步能力,采用 GPL-3.0 许可证开源。

GitHub 开源项目

0 阅读2026/09/15
查看指南
Abogen:用 Kokoro-82M 把 EPUB/PDF/文本转成带同步字幕的有声书 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

Abogen:用 Kokoro-82M 把 EPUB/PDF/文本转成带同步字幕的有声书

Abogen 是一个基于 Kokoro-82M 的文本转语音工具,可将 ePub、PDF、纯文本、Markdown 或字幕文件(SRT/ASS/VTT)快速转换为高质量音频并生成时间轴同步的字幕,适用于有声书、Instagram/YouTube/TikTok 配音等场景。项目提供 PyQt6 桌面 GUI(abogen)与 Flask Web UI(abogen-web)两种界面,支持章节拆分、M4B 章节与元数据、自定义语音混合、批处理队列、LLM 文本规范化与 Audiobookshelf 推送,可安装到 Windows、macOS、Linux 或用 Docker 部署。

GitHub 开源项目

0 阅读2026/09/14
查看指南
ebook2audiobook (E2A):从电子书生成带章节与元数据的有声书(支持语音克隆与 1158 种语言) 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

ebook2audiobook (E2A):从电子书生成带章节与元数据的有声书(支持语音克隆与 1158 种语言)

ebook2audiobook(E2A)是一个开源电子书转有声书工具,可在 CPU/GPU 上把 epub、mobi、pdf、txt 等格式的电子书转换为带章节和元数据的有声书,内置 XTTSv2、Bark、VITS、Tacotron2、YourTTS、Fairseq 等多款 TTS 引擎,支持自定义声音克隆与 1158 种语言,提供 Gradio Web GUI、无界面(headless)命令与 Docker/Docker Compose/Podman Compose 部署方式。

GitHub 开源项目

0 阅读2026/09/14
查看指南
GitHub - theajack/cnchar: 🇨🇳 功能全面的汉字工具库 (拼音 笔画 偏旁 成语 语音 可视化等) (Chinese character util) 阅览图
开源项目 · AI 音频与语音类
开源
开源项目·AI 音频与语音类·新手

GitHub - theajack/cnchar: 🇨🇳 功能全面的汉字工具库 (拼音 笔画 偏旁 成语 语音 可视化等) (Chinese character util)

🚀 功能全面、多端支持的汉字拼音笔画 js 库 English | 在线试用/文档 | 更新日志 | 反馈错误/缺漏 | Gitee | QQ Group: 958278438 | 留言板 Like this open source work? A small contribution keeps the project alive. 应用例子 开始文档之前,先通过一些应用案例看看 cnchar 能够做些什么 汉字打字游戏 | 打字弹钢琴 | 成语接龙 | 通讯录排序 | 取名字 | 输入法 | 歇后语 |

GitHub 开源项目

0 阅读2026/09/14
查看指南