评测观测 开源项目
浏览当前公开快照中经过筛选的 评测观测 AI 开源项目,并进入项目详情查看适用场景、部署条件、限制与核验证据。
当前展示 30 个可索引项目。
BerriAI/litellm
litellm 是一个开源 AI 网关与 Python SDK,以统一的 OpenAI 格式代理对 100 多种大语言模型的调用,并提供成本追踪、负载均衡、缓存和管理面板。
langfuse/langfuse
langfuse 是一个开源的 AI 工程平台,提供 LLM 可观测性、评估、提示词管理、数据集和试验场能力,支持自托管,可通过 Docker Compose 在本地快速运行。
mlabonne/llm-course
llm-course 是一份免费的结构化教程,涵盖从 LLM 基础理论到应用部署的完整学习路径,分为 LLM Fundamentals、LLM Scientist 和 LLM Engineer 三个模块,并配有可交互的 Colab 笔记本。
netdata/netdata
netdata 是一款基础设施监控工具,提供每秒一次的指标采集和零配置使用体验,在 Linux 等系统上默认资源占用较低。
unslothai/unsloth
unsloth 是一个支持通过 Web UI 和代码库在本地运行与训练文本、音频、嵌入及视觉模型的应用,旨在以更快的速度和更低的显存占用完成大模型任务。它同时提供数据集自动构建、模型导出和训练过程监控等支持性能力。
microsoft/promptflow
promptflow 是一套面向 LLM 应用的开发工具集,覆盖从原型设计、测试评估到生产部署的完整开发周期。它通过将 LLM、提示词和 Python 代码链接为可执行流程,辅助保障应用的生产质量。
Arize-ai/phoenix
phoenix 是一款用于 LLM 应用的开源 AI 可观测性平台,提供基于 OpenTelemetry 的追踪、评估、实验和数据集管理功能。它帮助 AI 工程师在缺乏专用平台的情况下,进行实验、评估和排查 LLM 应用问题。
SigNoz/signoz
SigNoz 是一个开源可观测性平台,基于 OpenTelemetry 标准将日志、指标、链路追踪、告警和仪表盘整合在一个平台中,并提供可预测的定价方式。
aishwaryanr/awesome-generative-ai-guide
awesome-generative-ai-guide 是一个围绕用户目标(使用、构建、理解、面试)和主题来组织生成式 AI 研究资料、课程与工具的综合性导航中心。该项目将海量静态资源梳理为结构化的学习路径与面试准备库,适合需要系统化获取生成式 AI 资料的用户。
mlflow/mlflow
mlflow/mlflow 将大语言模型与智能体的追踪、评估、提示词管理、模型网关能力,与传统机器学习的实验追踪、模型注册和部署放在同一平台中。适合希望统一管理人工智能应用与机器学习模型生命周期的团队,但选型前仍需核实数据边界、遥测、资源和外部服务成本要求。
promptfoo/promptfoo
promptfoo 是一个面向开发者的声明式 LLM 测试、自动化评估与红队安全扫描工具,旨在替代手工试错流程。它以本地 CLI 运行为核心,支持在 CI/CD 流水线中自动化检测提示词、模型及 RAG 系统的回归与安全问题。
alirezarezvani/claude-skills
claude-skills 是一个面向 AI 编程工具的可复用技能、智能体与角色库,涵盖 18 个领域的 358 个专业知识包,旨在为多种编程助手补充特定领域的专业能力。它支持通过插件命令或转换脚本接入多种 AI 编程工具,不需要 GPU 且不依赖付费服务。
recommenders-team/recommenders
recommenders 是一个用于推荐系统原型设计、实验与生产化的工具包,提供经典算法与深度学习算法的实现示例及可复用 Python 工件。需注意实验性模型未经充分测试且可能需要额外安装步骤。
comet-ml/opik
opik 为生成式 AI 应用、RAG 系统和智能体工作流提供链路追踪、自动化评估和生产监控仪表板,支持从原型到生产的完整生命周期。
EthicalML/awesome-production-machine-learning
awesome-production-machine-learning 是一个专注于生产级机器学习系统的开源库精选清单,按照多种 MLOps 类别进行分类整理,并附带搜索工具帮助用户在工具链中进行导航。
trycua/cua
cua 为 AI 智能体提供了一套开源的计算机界面操控驱动与跨操作系统沙盒 API,支持在后台运行原生桌面应用,并配备虚拟化管理与评测基准工具。
steipete/CodexBar
steipete/codexbar 是一个 macOS 14+ 菜单栏应用,旨在无需直接登录的情况下显示 OpenAI Codex 和 Claude Code 的使用量统计,并在菜单栏中展示额度限制及重置倒计时。
pydantic/pydantic-ai
pydantic-ai 是一个 Python Agent 框架,通过 Pydantic 验证提供类型安全和结构化输出,并支持多种外部大语言模型。该项目由 Pydantic 团队开发,旨在提供模型无关、类型安全的代理程序构建方式。
confident-ai/deepeval
deepeval 是一个类似于 Pytest 的开源大语言模型评估框架,专门用于对 LLM 应用进行单元测试,以评估系统质量并防止 Prompt 漂移。它通过提供一系列现成的指标,帮助开发者在输入数据集后输出量化的指标分数。
raga-ai-hub/RagaAI-Catalyst
ragaai-catalyst 是一个面向 LLM 和 Agentic AI 应用的 Python SDK,提供项目与数据集管理、追踪、评估、提示词管理、合成数据生成、护栏及红队测试等综合能力。使用该 SDK 需连接外部 RagaAI Catalyst 平台并进行身份认证。
apache/doris
apache/doris 是一个基于 MPP 架构的统一分析数据库,提供 SQL 分析、湖仓查询加速、流式数据摄入以及跨结构化数据、文本和向量的混合搜索。
modelscope/ms-swift
ms-swift 提供官方基础设施,用于高效微调、对齐、评估、量化和部署大量开源大语言模型与多模态大语言模型。该框架覆盖从训练(PEFT 或全参数技术)到推理、评估和部署的完整模型生命周期,支持 600+ 文本模型和 400+ 多模态模型。
ConardLi/easy-dataset
easy-dataset 是一款专注于将多格式领域文档转化为高质量结构化数据集的应用,覆盖微调数据构建、RAG 数据准备与评测集生成的全流程。它内置多种文本分割算法和人类盲测评测系统,适合需要从私有文档产出可训练数据的 AI 工程团队。
millionco/react-doctor
react-doctor 是一个确定性代码扫描工具,用于检测 React 代码库中的状态与副作用、性能、架构、安全和无障碍问题。它支持多种 React 框架和库,并能通过安装编码智能体技能帮助 AI 在未来避免同类问题。
NVIDIA/SkillSpector
skillspector 是一款安全检测工具,用于在 AI agent 技能安装前识别其中的漏洞、恶意模式和安全风险,通过静态分析及可选的 LLM 语义分析实现检测。
Data-Centric-AI-Community/fg-data-profiling
fg-data-profiling 面向 Pandas 和 Spark DataFrame 提供探索性数据分析(EDA)与数据质量剖析,用一行代码生成可导出的扩展分析报告。
ShishirPatil/gorilla
gorilla 提供经过微调的函数调用模型、基准测试、执行引擎以及经过策展的 API 数据集,用于构建和评估大语言模型的工具调用能力,同时降低调用外部工具和大量 API 时的幻觉问题。
jacobgil/pytorch-grad-cam
pytorch-grad-cam 是一个面向 PyTorch 计算机视觉模型的可解释 AI 方法库,通过 GradCAM、ScoreCAM 等像素归因方法生成类激活图,帮助用户可视化并诊断模型预测中起关键作用的像素区域。
zalandoresearch/fashion-mnist
fashion-mnist 是用于替代原始 MNIST 的图像数据集,图像尺寸与训练/测试划分结构与 MNIST 一致,旨在为机器学习算法提供更具挑战性的基准测试。
langchain-ai/open_deep_research
langchain-ai/open_deep_research 是一个可配置的开源深度研究智能体,通过协调大语言模型、搜索接口和模型上下文协议服务器生成研究报告。它支持更换模型与搜索工具,并提供本地网页界面、托管平台部署、评测配置和开放智能体平台部署路径。