AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
English
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
高频资源合集
更多筛选
0
配音制作与声音克隆
浏览当前公开快照中“配音制作与声音克隆”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
pot-app/pot-desktop
— pot-desktop 是一个跨平台桌面应用,聚合了多种外部和本地服务,提供划词翻译、输入翻译、截图 OCR、截图翻译及语音合成等功能。它通过可扩展的 .potext 插件系统实现功能增强,适合需要在 PC 端进行多源文本翻译和文字识别的用户。
harry0703/MoneyPrinterTurbo
— moneyprinterturbo 面向希望从主题或关键词生成短视频的创作者,可串联脚本、素材匹配、配音、字幕与视频合成。它更适合能够自行部署并配置模型及语音服务凭据的团队,而不是需要全托管服务的非技术用户。
unslothai/unsloth
— unsloth 是一个支持通过 Web UI 和代码库在本地运行与训练文本、音频、嵌入及视觉模型的应用,旨在以更快的速度和更低的显存占用完成大模型任务。它同时提供数据集自动构建、模型导出和训练过程监控等支持性能力。
RVC-Boss/GPT-SoVITS
— gpt-sovits 是一个支持零样本与少样本语音合成及克隆的 WebUI 工具,仅需 1 分钟语音数据即可训练出 TTS 模型,并支持多语言推理。
CorentinJ/Real-Time-Voice-Cloning
— real-time-voice-cloning 是基于 SV2TTS 深度学习框架的语音克隆工具箱,能够从数秒音频中提取声纹并合成任意目标文本的语音。该项目使用较早期的技术,适合用于学习和实验,不适合对音质有高标准的生产环境。
mudler/LocalAI
— localai 是一个开源 AI 引擎,可在用户自有基础设施上运行涵盖文本、音频、图像和视频的多模态模型,且不强制要求 GPU。它提供与 OpenAI、Anthropic 和 ElevenLabs API 兼容的接口,便于已有应用对接。
calesthio/OpenMontage
— openmontage 是一套端到端视频制作系统,通过外部 AI 编程助手自动化从构思到成片的流程化制作,支持真实素材或生成式视频组装,并带有质量校验环节。它不绑定特定供应商,将研究、提案、脚本、场景规划、资产生成、剪辑和合成编排为结构化阶段。
2noise/ChatTTS
— ChatTTS 是一款专为对话场景优化的文本转语音模型,支持多说话人及对笑声、停顿等细粒度韵律特征的控制。该模型目前仅支持学术研究用途,禁止商用。
myshell-ai/OpenVoice
— openvoice 是一款支持零样本语音克隆与跨语言合成的开源模型,能够准确复制参考音频的音色并对语音风格进行细粒度控制。项目提供 MIT 许可证,允许免费商用与研究使用。
babysor/MockingBird
— babysor/Mockingbird 是一个语音克隆与语音合成工具包,支持中文和多语言语音克隆,提供预训练模型、训练脚本及多种交互方式。它适用于需要定制中文语音合成的开发者和AI工程师,但部署难度较高。
OpenBMB/VoxCPM
— voxcpm 是一个无 tokenizer 的端到端文本转语音模型,支持 30 种语言并直接输出 48kHz 音频,提供基于自然语言描述的语音设计及声音克隆能力。项目支持本地运行。
fishaudio/fish-speech
— fish-speech 是一个支持 80 多种语言的文本转语音系统,提供短样本语音克隆与细粒度情感标签控制能力。该项目在 Seed-TTS Eval 基准测试中取得了包括闭源系统在内的所有受评模型中的最低词错误率(WER)。
ATH-MaaS/Pixelle-Video
— ath-maas/pixelle-video 面向希望从主题或脚本生成短视频、且不需要细粒度手工剪辑的创作者。它覆盖脚本、图像或视频素材、配音、背景音乐与成片合成,并允许通过不同服务或工作流替换部分生成组件。
QwenAudio/CosyVoice
— CosyVoice 是一个多语言大型语音生成模型,提供零样本语音克隆和文本到语音合成功能。该模型覆盖 9 种常用语言及 18 种以上的中文方言/口音,并支持延迟低至 150ms 的双向流式推理。
index-tts/index-tts
— index-tts/index-tts 适合需要本地自托管、零样本声音克隆,并希望将音色与情绪分开控制的开发团队。其优势是控制路径明确,但采用前需确认 NVIDIA GPU、CUDA 12.8 及以上环境和模型下载流程。
DrewThomasson/ebook2audiobook
— ebook2audiobook 将多种格式的电子书转换为带有章节和元数据的有声书,支持 1158 种语言和多种 TTS 引擎。该工具可选克隆自定义声音,并能以较低硬件门槛在本地或托管环境中运行。
nari-labs/dia
— nari-labs/dia 是一个支持通过文本转录本生成对话语音的模型,能够为语音添加情感、语调控制以及非语言声音。当前版本仅支持英文生成且需要 GPU 运行,项目明确声明仅供研究与教育用途,不适用于生产环境。
jianchang512/pyvideotrans
— pyvideotrans 将语音识别、字幕翻译、多角色配音和音视频合成串联为一条完整流水线,同时支持本地离线部署和多种主流在线 API。Windows 用户可直接使用预打包程序免配置运行。
NVIDIA-NeMo/Speech
— nvidia-nemo/speech 是面向研究人员和 PyTorch 开发者的语音 AI 框架,用于构建、定制和部署语音识别(ASR)、语音合成(TTS)及语音大模型。目前项目正处于转型期,重心转向音频、语音和多模态大模型。
PaddlePaddle/PaddleSpeech
— paddlespeech 是一个覆盖语音识别、语音合成、声音克隆、语音翻译和音频分类等任务的开源语音与音频处理工具包。它提供可通过命令行和服务端组件使用的训练、推理、测试与部署能力。
×