AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
语音音频
浏览当前公开快照中“语音音频”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
Comfy-Org/ComfyUI
— 结论:comfy-org/comfyui 适合希望通过节点图精细组织生成式工作流、同时保留本地离线与外部服务选择空间的创作者。它覆盖图像、视频、三维模型和音频生成,但采用自定义节点或面向共享生产环境部署前,需要核查版本兼容性与证书配置。
openai/whisper
— whisper 是一个基于大规模弱监督训练的通用语音识别模型,可通过单一模型完成多语言语音识别、语音翻译和语言辨识。它以多任务序列到序列方式替代传统语音处理流水线中的多个独立阶段。
jamiepine/voicebox
— voicebox 是一个本地优先的语音输入输出栈,将语音克隆、多引擎 TTS、全局听写与 MCP Agent 语音输出整合在同一桌面应用中。它面向希望替代云端语音服务、实现数据不出本地机器的开发者和创作者。
RVC-Boss/GPT-SoVITS
— gpt-sovits 是一个支持零样本与少样本语音合成及克隆的 WebUI 工具,仅需 1 分钟语音数据即可训练出 TTS 模型,并支持多语言推理。
huggingface/diffusers
— diffusers 是一个面向预训练扩散模型(覆盖图像、音频、视频)的模块化工具箱,提供推理流水线、可互换噪声调度器和可组合的预训练模型组件,基于 PyTorch 构建。它强调可用性优先于性能、可定制优先于抽象封装,适合需要在代码层面灵活控制生成与训练流程的开发者和研究人员。
moeru-ai/airi
— airi 是一个可自托管的 AI VTuber 伴侣应用,支持实时语音聊天、VRM/Live2D 模型动画展示及游玩 Minecraft 等游戏。项目基于 Web 技术构建,提供桌面和浏览器两种运行方式,可选配多种第三方语音和语言模型。
2noise/ChatTTS
— ChatTTS 是一款专为对话场景优化的文本转语音模型,支持多说话人及对笑声、停顿等细粒度韵律特征的控制。该模型目前仅支持学术研究用途,禁止商用。
Zackriya-Solutions/meetily
— meetily 是一款隐私优先的本地 AI 会议助手,能够完全在设备端捕获音频并完成实时转写与摘要,无需将数据发送至云端。它支持使用 Whisper 或 Parakeet 等模型进行本地推理,适合需要严格数据主权的会议记录场景。
OpenBMB/VoxCPM
— voxcpm 是一个无 tokenizer 的端到端文本转语音模型,支持 30 种语言并直接输出 48kHz 音频,提供基于自然语言描述的语音设计及声音克隆能力。项目支持本地运行。
ggml-org/whisper.cpp
— whisper.cpp 是一个以纯 C/C++ 实现的 OpenAI Whisper 模型推理库,用于在应用程序中集成语音识别功能。该实现无额外依赖,且运行时零内存分配,支持多种操作系统与硬件后端。
index-tts/index-tts
— index-tts/index-tts 适合需要本地自托管、零样本声音克隆,并希望将音色与情绪分开控制的开发团队。其优势是控制路径明确,但采用前需确认 NVIDIA GPU、CUDA 12.8 及以上环境和模型下载流程。
CorentinJ/Real-Time-Voice-Cloning
— real-time-voice-cloning 是基于 SV2TTS 深度学习框架的语音克隆工具箱,能够从数秒音频中提取声纹并合成任意目标文本的语音。该项目使用较早期的技术,适合用于学习和实验,不适合对音质有高标准的生产环境。
livekit/agents
— livekit/agents 是一个用于在服务器端构建实时、可编程、多模态语音 AI 参与者的框架,支持创建能看、能听、能理解的对话式语音代理。它提供 STT、LLM、TTS 和 Realtime API 的集成选项,并带有集成的任务调度功能。
coqui-ai/TTS
— coqui-ai/tts 是一个用于文本转语音生成的深度学习工具包,提供覆盖 1100 种以上语言的预训练模型,并具备模型训练与声音克隆能力。用户可通过命令行、Python 库或自带 Web 服务器在本地进行语音合成与开发。
QwenAudio/CosyVoice
— CosyVoice 是一个多语言大型语音生成模型,提供零样本语音克隆和文本到语音合成功能。该模型覆盖 9 种常用语言及 18 种以上的中文方言/口音,并支持延迟低至 150ms 的双向流式推理。
myshell-ai/OpenVoice
— openvoice 是一款支持零样本语音克隆与跨语言合成的开源模型,能够准确复制参考音频的音色并对语音风格进行细粒度控制。项目提供 MIT 许可证,允许免费商用与研究使用。
fishaudio/fish-speech
— fish-speech 是一个支持 80 多种语言的文本转语音系统,提供短样本语音克隆与细粒度情感标签控制能力。该项目在 Seed-TTS Eval 基准测试中取得了包括闭源系统在内的所有受评模型中的最低词错误率(WER)。
huggingface/speech-to-speech
— speech-to-speech 是一个模块化的开源语音智能体管道,VAD、STT、LLM、TTS 组件均可通过命令行参数替换,并通过兼容 OpenAI Realtime 协议的 WebSocket API 暴露服务,支持在自托管环境下构建低延迟的端到端语音交互助手。
kyutai-labs/pocket-tts
— pocket-tts 是一款轻量级、低延迟的文本转语音(TTS)应用,具备声音克隆功能。它专为标准 CPU 环境设计,无需依赖 GPU 或外部 Web API 即可高效运行。
duixcom/Duix-Avatar
— duix-avatar 是一款本地离线运行的 AI 数字人克隆与视频合成软件,用户无需联网即可在本地生成数字人视频。
SYSTRAN/faster-whisper
— systran/faster-whisper 适合需要在本地或自托管环境中运行 Whisper 转录、并关注推理速度与内存占用的开发者。项目支持 CPU 与 CUDA GPU、多种计算类型、批量转录、语音活动检测、单词级时间戳及模型转换,但采用最新 CTranslate2 时需核对 CUDA 12 与 cuDNN 9 的兼容性。
m-bain/whisperX
— whisperx 针对 Whisper 语句级时间戳可能偏差数秒且不支持批处理推理的问题,提供了带词级时间戳和说话人分离的快速语音识别方案。在 large-v2 模型下可达 70 倍实时速度,适合需要词级时间戳和多人会话转录的场景。
babysor/MockingBird
— babysor/Mockingbird 是一个语音克隆与语音合成工具包,支持中文和多语言语音克隆,提供预训练模型、训练脚本及多种交互方式。它适用于需要定制中文语音合成的开发者和AI工程师,但部署难度较高。
modelscope/FunASR
— FunASR 是一个工业级语音识别工具包,提供离线、流式及边缘部署的语音转写能力,涵盖 ASR、VAD、标点恢复、说话人分离和情绪识别。其提供高速语音识别(实时率因子最高可达 340 倍),旨在作为 Whisper 和云 API 的更快速替代方案。
DrewThomasson/ebook2audiobook
— ebook2audiobook 将多种格式的电子书转换为带有章节和元数据的有声书,支持 1158 种语言和多种 TTS 引擎。该工具可选克隆自定义声音,并能以较低硬件门槛在本地或托管环境中运行。
Lightricks/LTX-2
— lightricks/ltx-2 是首个基于 DiT 架构且开放获取的高保真音视频基础模型,适合需要在自托管环境中生成同步音视频的开发者与 AI 工程团队。它同时提供 Python 推理与 LoRA 训练工具,帮助团队构建从文本/图像生成到定制微调的完整链路。
multimodal-art-projection/YuE
— yue 是将文本歌词转换为包含人声和伴奏的完整歌曲的开源基础模型,生成的歌曲时长可达数分钟。
Huanshere/VideoLingo
— videolingo 是一条自动化视频翻译与配音流水线,能够生成单行字幕并合成配音视频。它通过 NLP 和 AI 技术处理视频的转录、翻译、对齐和配音环节。
waooAI/waoowaoo
— waoowaoo 是一款 AI 视频制作工具,能够将小说文本转化为分镜、角色、场景和完整的视频。该项目支持通过 Docker Compose 进行本地部署,并提供中文与英文界面。
Open-LLM-VTuber/Open-LLM-VTuber
— open-llm-vtuber 是面向语音交互式 AI 伙伴场景的跨平台应用,组合了实时语音对话、Live2D 形象、桌面宠物形态与多种模型后端。若希望使用本地模型实现可完全离线的角色化交互,它值得优先评估;但远程麦克风访问、Live2D 样例模型许可范围和版本迁移需要提前核查。
NVIDIA-NeMo/Speech
— nvidia-nemo/speech 是面向研究人员和 PyTorch 开发者的语音 AI 框架,用于构建、定制和部署语音识别(ASR)、语音合成(TTS)及语音大模型。目前项目正处于转型期,重心转向音频、语音和多模态大模型。
jianchang512/pyvideotrans
— pyvideotrans 将语音识别、字幕翻译、多角色配音和音视频合成串联为一条完整流水线,同时支持本地离线部署和多种主流在线 API。Windows 用户可直接使用预打包程序免配置运行。
abus-aikorea/voice-pro
— voice-pro 是一个基于 Gradio 的多功能语音处理 Web 应用,将语音识别、多语言翻译、配音、文本转语音、零样本声音克隆、音频处理、YouTube 下载和人声分离整合在单一界面中。它适合需要在一个工具内完成端到端音视频本地化与语音生成工作流的开发者和内容创作者。
WEIFENG2333/VideoCaptioner
— videocaptioner 是一款桌面端视频字幕处理工具,将语音转写、字幕优化、翻译和视频合成整合在一套流水线中。它提供免费的 ASR 与翻译选项(无需配置即可使用),同时也支持接入大语言模型(LLM)提升处理效果。
×