AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
RAG 与知识库
浏览当前公开快照中“RAG 与知识库”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
open-webui/open-webui
— open-webui 是一个可自托管、设计为支持离线运行的可扩展 AI 平台,提供 Web 界面管理 Ollama 本地模型与 OpenAI 兼容 API,并集成了检索增强生成(RAG)等丰富功能。
langgenius/dify
— dify 是一个将可视化 AI 工作流编排、RAG 数据管道、Agent 构建与模型管理融为一体的开源后端即服务平台。它通过提供直观的可视化界面与底层 API,帮助开发团队在无需编写大量基础代码的情况下,从原型过渡到生产级的 LLM 应用。
Graphify-Labs/graphify
— graphify 将本地代码、文档和媒体文件夹转化为可查询的知识图谱,使用 tree-sitter AST 对约 40 种语言进行确定性解析而无需调用 LLM。它生成可视化文件和结构化数据,并支持向 AI 编码助手暴露图谱查询能力。
Shubhamsaboo/awesome-llm-apps
— awesome-llm-apps 收录了 100 多个经过测试的端到端开源 AI 代理和 RAG 应用合集,涵盖了从基础单文件代理到多代理协作系统、语音和 RAG 流水线等多种架构模式。它适合开发者用来学习和快速启动各类 AI 应用原型。
langchain-ai/langchain
— langchain 是一个用于简化大语言模型应用开发的 Python 框架,通过提供标准接口帮助开发者将模型、向量数据库等互操作组件和第三方集成链接起来。它使开发者能够灵活地在不同抽象层级上构建和编排 AI 应用。
unclecode/crawl4ai
— crawl4ai 将网页内容转化为经过清洗的 Markdown 和结构化数据,适用于 RAG 和数据管道。该项目无需强制使用 API 密钥,提供包括 Python 库和 Docker 在内的多种部署方式,并具备浏览器控制与反爬虫规避能力。
datawhalechina/hello-agents
— hello-agents 是一套面向 AI Native Agent 构建的理论与实践结合教程,涵盖从核心范式实现到多智能体项目开发的系统化知识。该教程内容以中文为主,适合具备一定编程基础、希望系统学习智能体的开发者和学习者。
headroomlabs-ai/headroom
— headroom 是一个面向 LLM 代理上下文压缩的本地优先工具,通过对工具输出、日志和 RAG 分块等数据进行可逆压缩,在不丢失原始信息的前提下降低 Token 消耗。
bojieli/ai-agent-book
— ai-agent-book 是一本关于 AI Agent 设计原理与工程实践的开源书籍,提供涵盖 10 个章节的中英双语文本,并配有按章节组织的可运行示例项目。
infiniflow/ragflow
— ragflow 是一款面向企业的 RAG 引擎,核心特点是基于深度文档理解技术处理复杂格式的非结构化数据。它提供包含高质量文档分块和可溯源引用的 RAG 工作流,并支持配置外部 LLM 和嵌入模型。
THU-MAIC/OpenMAIC
— openmaic 将任意主题或文档转换为包含幻灯片、测验、模拟和项目式学习活动的交互式 AI 课堂体验,通过 AI 教师与同伴角色实现实时授课与讨论。
virgiliojr94/book-to-skill
— virgiliojr94/book-to-skill 将大型技术书籍或文档编译为可按需加载章节的结构化智能体技能,适合围绕单份长文档进行持续问答与知识复用。它支持本地运行,也提供不注册智能体技能的独立文本提取命令行工具。
ruvnet/ruflo
— ruflo 在 Claude Code 和 Codex 周围添加执行层,提供专业化智能体群组协调、自学习记忆与安全防护栏,面向需要多智能体协作完成复杂任务的开发者。
TencentCloud/TencentDB-Agent-Memory
— tencentdb-agent-memory 为 AI Agent 提供层级式长期记忆与符号化短期记忆能力,通过将繁重工具日志外部化并压缩任务状态,旨在减少 Token 消耗并提升长周期任务的成功率。
microsoft/generative-ai-for-beginners
— generative-ai-for-beginners 是微软推出的 21 节生成式 AI 入门课程,通过 Python 和 TypeScript 双语代码示例系统讲解核心概念并指导应用构建。适合具备基础编程能力并希望快速掌握大模型应用开发的开发者与教育者。
Egonex-AI/Understand-Anything
— understand-anything 是一个将代码库、知识库或文档转化为交互式知识图谱和可视化仪表盘的工具,帮助开发者理解项目的结构与业务逻辑。
microsoft/ai-agents-for-beginners
— ai-agents-for-beginners 是一个面向 AI Agent 初学者的结构化教学仓库,提供 18 课时的图文指南、视频和 Python 代码示例,覆盖从基础概念到生产部署的课程主题。
Mintplex-Labs/anything-llm
— anything-llm 提供了一套集成文档对话与 AI 代理能力的桌面或服务器端应用,支持本地隐私部署与多用户权限管理。用户无需编写代码即可通过图形界面将 PDF 等文件导入工作区进行问答交互。
opendatalab/MinerU
— mineru 是一款文档解析工具,可将 PDF、图片及 Office 文档转换为 Markdown 与 JSON 格式,服务于检索增强生成等下游处理流程。该项目支持复杂版面识别、公式与表格提取,并提供多种解析后端以适应不同硬件配置。
PaddlePaddle/PaddleOCR
— PaddleOCR 是一个文档解析库,旨在将非结构化的图像和 PDF 文档转换为结构化的 Markdown 或 JSON 数据,以支撑大语言模型应用。该项目提供了 0.9B 参数的轻量级视觉语言模型以及结构化解析能力。
run-llama/llama_index
— run-llama/llama_index 是一个面向 LLM 应用的数据框架,用于接入既有数据、组织数据,并在数据之上提供检索与查询接口。它适合需要用私有数据增强 LLM 应用或构建智能体应用的代码型团队。
AgriciDaniel/claude-obsidian
— claude-obsidian 是一个面向 Obsidian 的 AI 知识库代理,能够自主读取投递的文件或 URL,提取实体与概念并生成带有交叉链接的 Wiki 页面。它还能查询已有库内容并生成带引用的回答,帮助维护 Obsidian 知识图谱。
vectorize-io/hindsight
— vectorize-io/hindsight 是一个使用仿生数据结构为 AI 代理提供长期记忆的系统,让代理能够学习而不仅是回忆对话历史。它通过包装现有 LLM 客户端,仅需两行代码即可自动存储和检索记忆。
mem0ai/mem0
— mem0ai/mem0 为 AI 助手与 Agent 提供智能记忆层,支持跨会话保留用户偏好与会话状态,并实现自适应的个性化交互。其检索机制结合语义、BM25 关键词与实体匹配,并在 LoCoMo 基准测试中取得 92.5 分。
docling-project/docling
— docling-project/docling 是一个文档处理库,能够解析包括 PDF 在内的多种文档格式,为生成式 AI 应用提供统一的文档表示格式和广泛的解析能力。
milvus-io/milvus
— milvus 是一款云原生向量数据库,支持在十亿级向量规模下进行可扩展的向量近似最近邻(ANN)搜索,并支持实时流式更新。
nashsu/llm_wiki
— llm_wiki 是一款桌面应用,利用 LLM 从用户的文档中增量构建并维护一个持久化、相互链接的知识 wiki。它与传统 RAG 的区别在于将知识编译为有组织的持久结构,而非每次从零开始检索和回答。
Tencent/WeKnora
— tencent/weknora 适合希望把分散文档转为可检索问答、智能体推理结果和结构化知识 Wiki 的团队,尤其值得评估其文档到关联 Markdown 页面与知识图谱的转换能力。选型前应先确认模型提供方、数据边界、网络访问控制和硬件需求。
deepset-ai/haystack
— haystack 是一个 Python 框架,用于构建生产就绪的 LLM 应用程序,通过模块化管道编排检索、路由和生成过程。该框架允许开发者对信息进行检索、过滤和组合后提供给模型,并支持在系统间切换不同的模型或基础设施组件。
lfnovo/open-notebook
— open-notebook 是一个可自托管的多模态 AI 研究笔记本,提供内容组织、上下文对话、搜索及播客生成功能,定位为注重数据主权的替代方案。
anthropics/claude-cookbooks
— claude-cookbooks 是 Anthropic 官方维护的教程与代码片段集合,提供基于 Claude API 的 Jupyter Notebook 示例,帮助开发者学习如何构建应用。
weaviate/weaviate
— weaviate 是一款云原生向量数据库,将向量相似度搜索、关键字过滤与生成式 RAG 能力整合在单一查询中,旨在解决 AI 应用在规模化场景下需要独立部署检索、向量存储与生成系统的难题。
vitali87/code-graph-rag
— code-graph-rag 使用 Tree-sitter 将多语言代码库解析为知识图谱(存储于 Memgraph),支持通过自然语言查询、编辑和优化代码。
assafelovic/gpt-researcher
— gpt-researcher 是一个自主深度研究代理,通过并行聚合超过 20 个网络或本地数据源,生成带有引用的详细研究报告。它采用规划与执行智能体协作完成研究任务,适用于需要客观、时效性信息整理的场景。
RyanCodrai/turbovec
— turbovec 是一个基于 Rust 构建的向量索引库,通过 TurboQuant 技术将嵌入向量压缩至 2-bit 或 4-bit,无需单独训练阶段,并依赖手写 SIMD 内核提供较快的搜索速度。
MemPalace/mempalace
— mempalace 面向需要长期保留人工智能编码会话上下文的开发者,以本地逐字存储、分层检索和可替换后端组织记忆。若重点是避免摘要改写并衔接多次编码会话,值得优先评估;若必须使用托管服务,则当前不适用。
huggingface/agents-course
— huggingface/agents-course 是一门免费的结构化在线课程,教学目标是使用 smolagents、LangGraph 和 LlamaIndex 等框架构建、评估 AI 智能体。课程从智能体基础知识开始,延伸至最终的基准测试作业与自动化评估。
rohitg00/agentmemory
— agentmemory 为 AI 编码代理提供持久记忆的本地 MCP 服务器。通过记录会话和混合搜索降低 token 消耗,避免跨会话重复输入上下文。
stanford-oval/storm
— storm 是一个通过检索与多视角问答来自动化研究流程的系统,能够从零开始生成带引用的长篇文章。它支持人机协作的知识整理模式,并提供模块化的引擎定制接口。
khoj-ai/khoj
— 结论:khoj 适合希望通过自托管或托管服务检索个人文档、查询互联网并与本地或在线大模型对话的用户。它还覆盖自定义智能体、研究自动化以及浏览器、桌面和移动端等访问方式,但选型前需另行确认 GPU、最低硬件和遥测要求。
×