AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
模型服务 / 推理
浏览当前公开快照中“模型服务 / 推理”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
open-webui/open-webui
— open-webui 是一个可自托管、设计为支持离线运行的可扩展 AI 平台,提供 Web 界面管理 Ollama 本地模型与 OpenAI 兼容 API,并集成了检索增强生成(RAG)等丰富功能。
ollama/ollama
— ollama/ollama 提供了一种在本地运行开源大语言模型的简便方式,支持通过 CLI、REST API 和编程语言库进行交互。
huggingface/transformers
— transformers 是覆盖文本、视觉、音频、视频和多模态的统一模型定义库。它通过提供低门槛的统一 API、支持共享已训练权重以减少算力消耗,并允许在 PyTorch/JAX/TF2.0 框架间迁移模型来提供服务。
ggml-org/llama.cpp
— llama.cpp 是一个纯 C/C++ 实现的 LLM 推理引擎,无任何外部依赖,支持通过整数(1.5-8-bit)量化在本地或云端硬件上运行模型推理。它提供了覆盖 CLI 交互、文本生成、模型量化与多模态处理的核心工具链。
Alishahryar1/free-claude-code
— free-claude-code 是一个本地代理工具,允许 Claude Code、Codex、Pi 及其 IDE 扩展通过自有的提供商代理运行。它支持在本地管理界面中配置和验证多达 25 个云端或本地模型提供商。
jingyaogong/minimind
— minimind 是一个面向个人学习者的开源教育项目,提供从零开始用 PyTorch 训练 64M 参数大型语言模型的全流程代码与配套数据集。项目覆盖预训练到强化学习对齐的完整环节,旨在降低理解 LLM 的门槛。
unslothai/unsloth
— unsloth 是一个支持通过 Web UI 和代码库在本地运行与训练文本、音频、嵌入及视觉模型的应用,旨在以更快的速度和更低的显存占用完成大模型任务。它同时提供数据集自动构建、模型导出和训练过程监控等支持性能力。
vllm-project/vllm
— vllm 是一个面向大语言模型的高吞吐量且具有内存效率的推理与服务引擎,适合需要高效部署 LLM 的开发者和运维团队。
tashfeenahmed/freellmapi
— freellmapi 是一个将多家 LLM 提供商免费额度聚合在单一 OpenAI 兼容 /v1 端点后面的路由代理服务,提供智能路由、自动故障转移和密钥加密存储。它面向个人实验与学习场景,支持自托管和本地运行。
cactus-compute/needle
— needle 是一个拥有 2600 万参数的注意力网络模型,用于在手机、可穿戴设备、智能家居设备等小型消费设备上运行 AI 函数调用。该模型大小为 14MB,在 Cactus 上可实现每秒 6000 token 的预填充速度,并支持本地微调。
FareedKhan-dev/kimi-k3-in-c
— fareedkhan-dev/kimi-k3-in-c 是一个用纯 C99 编写的推理引擎,通过从磁盘流式加载非驻留专家,在单 CPU 和 8.24 GB RAM 的条件下运行 2.78 万亿参数的混合专家模型,输出与全驻留运行时字节一致。
BerriAI/litellm
— litellm 是一个开源 AI 网关与 Python SDK,以统一的 OpenAI 格式代理对 100 多种大语言模型的调用,并提供成本追踪、负载均衡、缓存和管理面板。
AUTOMATIC1111/stable-diffusion-webui
— stable-diffusion-webui 是一个基于 Gradio 的 Stable Diffusion Web 界面,提供文生图、图生图、模型训练等功能。该项目提供安装脚本并支持在 4GB 显存的显卡上运行,适合需要在本地运行和管理图像生成的用户。
google-research/timesfm
— TimesFM 是一个预训练的 decoder-only 时间序列预测基础模型,旨在为时间序列预测提供稳健的解决方案。
sgl-project/sglang
— sglang 是一个面向大语言模型和多模态模型的服务框架,通过 RadixAttention、零开销调度器和连续批处理等运行时特性,提供低延迟、高吞吐的推理能力,并具备多硬件平台兼容性。
drumih/turbo-fieldfare
— turbo-fieldfare 是一个用于在 Apple Silicon Mac 上本地运行大语言模型的自定义 Swift + Metal 运行时,通过从 SSD 流式加载所需的专家模块,使 Gemma 4 26B-A4B 模型能在约 2 GB 内存中运行。
decolua/9router
— 9router 是一个智能路由器,将 AI 编程工具连接到免费或低价模型,通过跨层级自动回退避免中断,并压缩工具输出以节省 20-40% 的 token。它解决了订阅额度闲置、速率限制打断编程会话以及工具输出消耗过多 token 的问题。
jundot/omlx
— omlx 是面向 Apple Silicon 的本地 LLM 推理服务,核心特征是分层 KV 缓存(热数据驻留 RAM、冷数据卸载至 SSD)在服务重启后仍可恢复,并通过 macOS 菜单栏应用和 Web 管理面板进行管理。兼容 OpenAI 与 Anthropic API 格式,支持并发批处理与多模型同服。
chatanywhere/GPT_API_free
— gpt_api_free 提供免费和付费两种方式,使用户无需 VPN 即可通过统一的 OpenAI 协议访问多种主流大语言模型 API。该项目为个人学习、教育或非营利研究提供了低门槛的 API 接入途径,但免费密钥受每日请求次数和 Token 数量的限制。
hiyouga/LlamaFactory
— llamafactory 为 100 多种大语言模型和视觉语言模型提供统一微调框架,支持通过零代码 CLI 和 Web UI 完成训练,涵盖从持续预训练到 DPO/PPO 等多种算法与量化调优方案。
shiyu-coder/Kronos
— Kronos 是一个面向金融 K 线(蜡烛图)序列的预训练基础模型,采用分层分词器和自回归 Transformer 架构,旨在支持多种量化任务。该项目自述在超过 45 个全球交易所的数据上进行了预训练,并称自身为首个针对金融 K 线的开源基础模型。
ultralytics/ultralytics
— ultralytics 提供覆盖检测、分割、分类、姿态估计和目标追踪的实时计算机视觉模型开发与部署能力,通过统一的 CLI 和 Python API 交付 YOLO 模型。模型会在首次使用时自动下载,适合需要快速上手和迭代的视觉任务场景。
microsoft/qlib
— Qlib 是一个面向量化投资研究的模块化框架,覆盖从数据处理到模型训练再到回测的完整流程。它通过 qrun 工具自动串联整个工作流,支持包括强化学习在内的多种机器学习范式。
2noise/ChatTTS
— ChatTTS 是一款专为对话场景优化的文本转语音模型,支持多说话人及对笑声、停顿等细粒度韵律特征的控制。该模型目前仅支持学术研究用途,禁止商用。
OpenBMB/VoxCPM
— voxcpm 是一个无 tokenizer 的端到端文本转语音模型,支持 30 种语言并直接输出 48kHz 音频,提供基于自然语言描述的语音设计及声音克隆能力。项目支持本地运行。
songquanpeng/one-api
— one-api 将多个 LLM 提供商的访问统一到标准 OpenAI API 格式之下,提供密钥管理与二次分发能力。它通过多渠道路由分发请求,帮助开发者和团队统一接口调用。
Nasiko-Labs/nasiko
— nasiko 是一个面向生产环境的 AI 代理控制平面,将多代理的部署、智能路由、可观测性和生命周期管理整合在一个平台中。它通过 Kong 网关和 LangChain 驱动的路由机制,为开发团队提供代理规模扩展时的基础设施支持。
xtekky/gpt4free
— gpt4free 是一个聚合多种 LLM 与媒体生成提供方的开源项目,提供本地 GUI、OpenAI 兼容 REST API 及 Python/JavaScript 客户端。它通过多提供方适配器将请求路由至不同的外部或本地服务,降低了对单一服务的依赖。
mudler/LocalAI
— localai 是一个开源 AI 引擎,可在用户自有基础设施上运行涵盖文本、音频、图像和视频的多模态模型,且不强制要求 GPU。它提供与 OpenAI、Anthropic 和 ElevenLabs API 兼容的接口,便于已有应用对接。
keras-team/keras
— keras 是一个高级深度学习框架,支持在 JAX、TensorFlow、PyTorch 和 OpenVINO 后端上构建、训练和推理模型,旨在提供易调试的开发体验并规避框架锁定。
index-tts/index-tts
— index-tts/index-tts 适合需要本地自托管、零样本声音克隆,并希望将音色与情绪分开控制的开发团队。其优势是控制路径明确,但采用前需确认 NVIDIA GPU、CUDA 12.8 及以上环境和模型下载流程。
ultralytics/yolov5
— ultralytics/yolov5 是一个基于 PyTorch 的视觉 AI 模型,支持目标检测、实例分割和图像分类任务,可用于快速训练、推理和部署。
janhq/jan
— janhq/jan 是一款面向本地大模型交互的桌面应用,可下载并运行来自 HuggingFace 的兼容模型,也可按需连接多家云模型服务。它适合希望通过图形界面使用本地模型,同时保留云端模型与本地接口扩展路径的个人用户和开发者。
musistudio/claude-code-router
— musistudio/claude-code-router 是一个本地控制平面,提供单一且稳定的本地端点,用于在多个编码代理和提供商之间管理配置、模型、路由规则和工具。它旨在应对在多个代理和提供商之间切换模型时独立维护配置容易中断的问题。
ray-project/ray
— ray 是一个统一的 Python 与 AI 应用分布式框架,旨在将计算密集型机器学习负载从单机开发环境扩展到集群。它提供无状态任务、有状态 Actor 和不可变对象的分布式抽象。
oobabooga/textgen
— textgen 是一个用于在本地运行大型语言模型的桌面应用程序,支持文本、视觉和工具调用功能,并提供与 OpenAI/Anthropic 兼容的 API。该应用程序运行时无任何遥测,确保数据边界仅限本地。
coqui-ai/TTS
— coqui-ai/tts 是一个用于文本转语音生成的深度学习工具包,提供覆盖 1100 种以上语言的预训练模型,并具备模型训练与声音克隆能力。用户可通过命令行、Python 库或自带 Web 服务器在本地进行语音合成与开发。
QwenAudio/CosyVoice
— CosyVoice 是一个多语言大型语音生成模型,提供零样本语音克隆和文本到语音合成功能。该模型覆盖 9 种常用语言及 18 种以上的中文方言/口音,并支持延迟低至 150ms 的双向流式推理。
gradio-app/gradio
— gradio 让开发者仅用 Python 即可为机器学习模型或任意 Python 函数构建可交互的 Web 演示与应用,无需编写 JavaScript、CSS 或处理 Web 托管。
Kong/kong
— kong 是一个云原生、平台无关且可扩展的网关,通过插件系统提供扩展性。它集中处理 API、LLM 和 MCP 流量,为微服务架构提供统一的编排与代理层。
×