AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
评测观测
浏览当前公开快照中“评测观测”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
unslothai/unsloth
— unsloth 是一个支持通过 Web UI 和代码库在本地运行与训练文本、音频、嵌入及视觉模型的应用,旨在以更快的速度和更低的显存占用完成大模型任务。它同时提供数据集自动构建、模型导出和训练过程监控等支持性能力。
BerriAI/litellm
— litellm 是一个开源 AI 网关与 Python SDK,以统一的 OpenAI 格式代理对 100 多种大语言模型的调用,并提供成本追踪、负载均衡、缓存和管理面板。
ifixai-ai/iFixAi
— ifixai 是一个面向 AI 代理的对齐风险检测工具,通过运行多项检查来发现捏造、操纵、欺骗、不可预测和不透明等盲点,并在 5 分钟内生成可引用的 A-F 字母评级。
langfuse/langfuse
— langfuse 是一个开源的 AI 工程平台,提供 LLM 可观测性、评估、提示词管理、数据集和试验场能力,支持自托管,可通过 Docker Compose 在本地快速运行。
mlabonne/llm-course
— llm-course 是一份免费的结构化教程,涵盖从 LLM 基础理论到应用部署的完整学习路径,分为 LLM Fundamentals、LLM Scientist 和 LLM Engineer 三个模块,并配有可交互的 Colab 笔记本。
netdata/netdata
— netdata 是一款基础设施监控工具,提供每秒一次的指标采集和零配置使用体验,在 Linux 等系统上默认资源占用较低。
NVIDIA/SkillSpector
— skillspector 是一个面向 AI agent 技能的安全扫描工具,用于在安装 agent 技能之前检测漏洞、恶意代码模式和安全风险。它支持对 Git 仓库、URL、zip 文件、目录或单个文件进行静态分析,并提供 0-100 的风险评分和建议。
alirezarezvani/claude-skills
— claude-skills 是一个面向 AI 编程工具的可复用技能、智能体与角色库,涵盖 18 个领域的 358 个专业知识包,旨在为多种编程助手补充特定领域的专业能力。它支持通过插件命令或转换脚本接入多种 AI 编程工具,不需要 GPU 且不依赖付费服务。
getagentseal/codeburn
— codeburn 是一款本地优先的 AI 编码成本分析与优化工具,通过读取 32 种主流 AI 编码工具的会话文件,为开发者和团队提供细粒度的 Token 消耗追踪与浪费检测。它无需代理或 API 密钥即可部署,能帮助用户发现无效支出并修复配置问题。
trycua/cua
— cua 为 AI 智能体提供了一套开源的计算机界面操控驱动与跨操作系统沙盒 API,支持在后台运行原生桌面应用,并配备虚拟化管理与评测基准工具。
steipete/CodexBar
— steipete/codexbar 是一个 macOS 14+ 菜单栏应用,旨在无需直接登录的情况下显示 OpenAI Codex 和 Claude Code 的使用量统计,并在菜单栏中展示额度限制及重置倒计时。
promptfoo/promptfoo
— promptfoo 是一个面向开发者的声明式 LLM 测试、自动化评估与红队安全扫描工具,旨在替代手工试错流程。它以本地 CLI 运行为核心,支持在 CI/CD 流水线中自动化检测提示词、模型及 RAG 系统的回归与安全问题。
aishwaryanr/awesome-generative-ai-guide
— awesome-generative-ai-guide 是一个围绕用户目标(使用、构建、理解、面试)和主题来组织生成式 AI 研究资料、课程与工具的综合性导航中心。该项目将海量静态资源梳理为结构化的学习路径与面试准备库,适合需要系统化获取生成式 AI 资料的用户。
Arize-ai/phoenix
— phoenix 是一款用于 LLM 应用的开源 AI 可观测性平台,提供基于 OpenTelemetry 的追踪、评估、实验和数据集管理功能。它帮助 AI 工程师在缺乏专用平台的情况下,进行实验、评估和排查 LLM 应用问题。
vercel-labs/deepsec
— deepsec 是一个利用 AI 代理对大规模代码仓库进行按需、并行安全漏洞审查的工具,旨在发现长期潜伏于代码库中的难以察觉的安全问题。
mlflow/mlflow
— mlflow/mlflow 将大语言模型与智能体的追踪、评估、提示词管理、模型网关能力,与传统机器学习的实验追踪、模型注册和部署放在同一平台中。适合希望统一管理人工智能应用与机器学习模型生命周期的团队,但选型前仍需核实数据边界、遥测、资源和外部服务成本要求。
comet-ml/opik
— opik 为生成式 AI 应用、RAG 系统和智能体工作流提供链路追踪、自动化评估和生产监控仪表板,支持从原型到生产的完整生命周期。
SigNoz/signoz
— SigNoz 是一个开源可观测性平台,基于 OpenTelemetry 标准将日志、指标、链路追踪、告警和仪表盘整合在一个平台中,并提供可预测的定价方式。
pydantic/pydantic-ai
— pydantic-ai 是一个 Python Agent 框架,通过 Pydantic 验证提供类型安全和结构化输出,并支持多种外部大语言模型。该项目由 Pydantic 团队开发,旨在提供模型无关、类型安全的代理程序构建方式。
confident-ai/deepeval
— deepeval 是一个类似于 Pytest 的开源大语言模型评估框架,专门用于对 LLM 应用进行单元测试,以评估系统质量并防止 Prompt 漂移。它通过提供一系列现成的指标,帮助开发者在输入数据集后输出量化的指标分数。
microsoft/promptflow
— promptflow 是一套面向 LLM 应用的开发工具集,覆盖从原型设计、测试评估到生产部署的完整开发周期。它通过将 LLM、提示词和 Python 代码链接为可执行流程,辅助保障应用的生产质量。
modelscope/ms-swift
— ms-swift是一个统一框架,覆盖大语言模型与多模态大模型的微调、部署、评估和量化全流程,支持600+文本模型和400+多模态模型。
Tracer-Cloud/opensre
— opensre 是一个开源框架,用于在用户自有基础设施上构建可调查生产事故的 AI SRE 智能体。该框架收集并关联告警上下文、日志、指标、链路追踪与近期部署信息,生成包含可能根因及关联证据的结构化调查报告。
millionco/react-doctor
— react-doctor 是一个确定性地扫描代码库以发现 React 问题的工具,覆盖状态与副作用、性能、架构、安全和无障碍访问等维度。它可为编码智能体安装学习技能、在 CI 中审查每个拉取请求并仅报告本次变更引入的问题。
vibrantlabsai/ragas
— ragas 是一个用于评估和优化 LLM 应用的开源库,通过客观指标、测试集生成和数据驱动的洞察,替代耗时的主观人工评估。项目支持通过 Python 库集成到现有工作流中,并提供了快速入门模板。
Andyyyy64/whichllm
— andyyyy64/whichllm 是面向本地大模型选型与硬件规划的命令行工具,核心价值是按显存适配、生成速度、真实基准与新近程度给出排序,而不是只看参数量。它尤其适合想先确认“当前机器或目标显卡能跑什么”,再进入聊天或代码调用的用户。
NVIDIA/garak
— garak 是一款用于对大语言模型和对话系统进行红队测试与安全评估的命令行工具,通过探测幻觉、数据泄漏、提示注入、毒性、越狱等安全弱点并报告检测到的失败。
EthicalML/awesome-production-machine-learning
— awesome-production-machine-learning 是一个专注于生产级机器学习系统的开源库精选清单,按照多种 MLOps 类别进行分类整理,并附带搜索工具帮助用户在工具链中进行导航。
recommenders-team/recommenders
— recommenders 是一个用于推荐系统原型设计、实验与生产化的工具包,提供经典算法与深度学习算法的实现示例及可复用 Python 工件。需注意实验性模型未经充分测试且可能需要额外安装步骤。
×