AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
English
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
会议记录
浏览当前公开快照中“会议记录”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
Zackriya-Solutions/meetily
— meetily 是一款隐私优先的本地 AI 会议助手,能够完全在设备端捕获音频并完成实时转写与摘要,无需将数据发送至云端。它支持使用 Whisper 或 Parakeet 等模型进行本地推理,适合需要严格数据主权的会议记录场景。
openai/whisper
— whisper 是一个基于大规模弱监督训练的通用语音识别模型,可通过单一模型完成多语言语音识别、语音翻译和语言辨识。它以多任务序列到序列方式替代传统语音处理流水线中的多个独立阶段。
RVC-Boss/GPT-SoVITS
— gpt-sovits 是一个支持零样本与少样本语音合成及克隆的 WebUI 工具,仅需 1 分钟语音数据即可训练出 TTS 模型,并支持多语言推理。
ggml-org/whisper.cpp
— whisper.cpp 是一个以纯 C/C++ 实现的 OpenAI Whisper 模型推理库,用于在应用程序中集成语音识别功能。该实现无额外依赖,且运行时零内存分配,支持多种操作系统与硬件后端。
OpenBMB/VoxCPM
— voxcpm 是一个无 tokenizer 的端到端文本转语音模型,支持 30 种语言并直接输出 48kHz 音频,提供基于自然语言描述的语音设计及声音克隆能力。项目支持本地运行。
mozilla-ai/llamafile
— llamafile 将 llama.cpp 与 Cosmopolitan Libc 结合,把大语言模型及其运行环境打包为单一可执行文件,在多数操作系统和 CPU 架构上本地运行且无需安装。它解决了分发和运行大语言模型时面临的安装与跨平台兼容性难题。
SYSTRAN/faster-whisper
— systran/faster-whisper 适合需要在本地或自托管环境中运行 Whisper 转录、并关注推理速度与内存占用的开发者。项目支持 CPU 与 CUDA GPU、多种计算类型、批量转录、语音活动检测、单词级时间戳及模型转换,但采用最新 CTranslate2 时需核对 CUDA 12 与 cuDNN 9 的兼容性。
m-bain/whisperX
— whisperx 针对 Whisper 语句级时间戳可能偏差数秒且不支持批处理推理的问题,提供了带词级时间戳和说话人分离的快速语音识别方案。在 large-v2 模型下可达 70 倍实时速度,适合需要词级时间戳和多人会话转录的场景。
screenpipe/screenpipe
— screenpipe 将本地屏幕和音频录制转化为可搜索的 AI 记忆与自动化系统,数据默认在本地存储。它通过事件驱动捕获、音频转写、自然语言搜索及 Pipes 插件系统,帮助用户在严格保护隐私的前提下记录和调用电脑活动数据。
DrewThomasson/ebook2audiobook
— ebook2audiobook 将多种格式的电子书转换为带有章节和元数据的有声书,支持 1158 种语言和多种 TTS 引擎。该工具可选克隆自定义声音,并能以较低硬件门槛在本地或托管环境中运行。
modelscope/FunASR
— FunASR 是一个工业级语音识别工具包,提供离线、流式及边缘部署的语音转写能力,涵盖 ASR、VAD、标点恢复、说话人分离和情绪识别。其提供高速语音识别(实时率因子最高可达 340 倍),旨在作为 Whisper 和云 API 的更快速替代方案。
jianchang512/pyvideotrans
— pyvideotrans 将语音识别、字幕翻译、多角色配音和音视频合成串联为一条完整流水线,同时支持本地离线部署和多种主流在线 API。Windows 用户可直接使用预打包程序免配置运行。
NVIDIA-NeMo/Speech
— nvidia-nemo/speech 是面向研究人员和 PyTorch 开发者的语音 AI 框架,用于构建、定制和部署语音识别(ASR)、语音合成(TTS)及语音大模型。目前项目正处于转型期,重心转向音频、语音和多模态大模型。
kaldi-asr/kaldi
— kaldi 是一个用 C++ 编写的语音识别工具包,提供构建语音识别系统所需的基础代码和示例脚本。使用者需要从源码编译项目,适合有 C++ 和命令行经验的开发人员。
alphacep/vosk-api
— vosk-api 是一个离线语音识别库,提供涵盖 20+ 语言的连续大词表转录、流式 API、说话人识别和可重配词表功能。借助 50MB 级别的紧凑模型,它能够在从 Raspberry Pi 到大型服务器的多种设备上本地运行,适用于对隐私要求高且不依赖云服务的场景。
PaddlePaddle/PaddleSpeech
— paddlespeech 是一个覆盖语音识别、语音合成、声音克隆、语音翻译和音频分类等任务的开源语音与音频处理工具包。它提供可通过命令行和服务端组件使用的训练、推理、测试与部署能力。
codexu/note-gen
— note-gen 是一款采用"先捕获、后整理"模式的桌面笔记应用,利用 AI 将零散的文本、录音、截图和文件等原始记录转化为结构化的 Markdown 笔记。
×