模型服务 / 推理 开源项目
浏览当前公开快照中经过筛选的 模型服务 / 推理 AI 开源项目,并进入项目详情查看适用场景、部署条件、限制与核验证据。
当前展示 40 个可索引项目。
ollama/ollama
ollama/ollama 提供了一种在本地运行开源大语言模型的简便方式,支持通过 CLI、REST API 和编程语言库进行交互。
open-webui/open-webui
open-webui 是一个可自托管、设计为支持离线运行的可扩展 AI 平台,提供 Web 界面管理 Ollama 本地模型与 OpenAI 兼容 API,并集成了检索增强生成(RAG)等丰富功能。
huggingface/transformers
transformers 是覆盖文本、视觉、音频、视频和多模态的统一模型定义库。它通过提供低门槛的统一 API、支持共享已训练权重以减少算力消耗,并允许在 PyTorch/JAX/TF2.0 框架间迁移模型来提供服务。
Robbyant/lingbot-map
robbyant/lingbot-map 面向图像或视频流的三维场景重建,适合需要研究流式重建、长序列推理与点云可视化,并能自行准备 CUDA 环境和模型权重的团队。它提供交互查看、离线漫游视频渲染及基准评测工具,但显存占用、缓存长度和训练距离范围会影响选型。
AUTOMATIC1111/stable-diffusion-webui
stable-diffusion-webui 是一个基于 Gradio 的 Stable Diffusion Web 界面,提供文生图、图生图、模型训练等功能。该项目提供安装脚本并支持在 4GB 显存的显卡上运行,适合需要在本地运行和管理图像生成的用户。
vllm-project/vllm
vllm 是一个面向大语言模型的高吞吐量且具有内存效率的推理与服务引擎,适合需要高效部署 LLM 的开发者和运维团队。
ggml-org/llama.cpp
llama.cpp 是一个纯 C/C++ 实现的 LLM 推理引擎,无任何外部依赖,支持通过整数(1.5-8-bit)量化在本地或云端硬件上运行模型推理。它提供了覆盖 CLI 交互、文本生成、模型量化与多模态处理的核心工具链。
BerriAI/litellm
litellm 是一个开源 AI 网关与 Python SDK,以统一的 OpenAI 格式代理对 100 多种大语言模型的调用,并提供成本追踪、负载均衡、缓存和管理面板。
2noise/ChatTTS
ChatTTS 是一款专为对话场景优化的文本转语音模型,支持多说话人及对笑声、停顿等细粒度韵律特征的控制。该模型目前仅支持学术研究用途,禁止商用。
hiyouga/LlamaFactory
llamafactory 为 100 多种大语言模型和视觉语言模型提供统一微调框架,支持通过零代码 CLI 和 Web UI 完成训练,涵盖从持续预训练到 DPO/PPO 等多种算法与量化调优方案。
unslothai/unsloth
unsloth 是一个支持通过 Web UI 和代码库在本地运行与训练文本、音频、嵌入及视觉模型的应用,旨在以更快的速度和更低的显存占用完成大模型任务。它同时提供数据集自动构建、模型导出和训练过程监控等支持性能力。
xtekky/gpt4free
gpt4free 是一个聚合多种 LLM 与媒体生成提供方的开源项目,提供本地 GUI、OpenAI 兼容 REST API 及 Python/JavaScript 客户端。它通过多提供方适配器将请求路由至不同的外部或本地服务,降低了对单一服务的依赖。
keras-team/keras
keras 是一个高级深度学习框架,支持在 JAX、TensorFlow、PyTorch 和 OpenVINO 后端上构建、训练和推理模型,旨在提供易调试的开发体验并规避框架锁定。
ultralytics/ultralytics
ultralytics 提供覆盖检测、分割、分类、姿态估计和目标追踪的实时计算机视觉模型开发与部署能力,通过统一的 CLI 和 Python API 交付 YOLO 模型。模型会在首次使用时自动下载,适合需要快速上手和迭代的视觉任务场景。
songquanpeng/one-api
one-api 将多个 LLM 提供商的访问统一到标准 OpenAI API 格式之下,提供密钥管理与二次分发能力。它通过多渠道路由分发请求,帮助开发者和团队统一接口调用。
ultralytics/yolov5
ultralytics/yolov5 是一个基于 PyTorch 的视觉 AI 模型,支持目标检测、实例分割和图像分类任务,可用于快速训练、推理和部署。
jingyaogong/minimind
minimind 是一个面向个人学习者的开源教育项目,提供从零开始用 PyTorch 训练 64M 参数大型语言模型的全流程代码与配套数据集。项目覆盖预训练到强化学习对齐的完整环节,旨在降低理解 LLM 的门槛。
mudler/LocalAI
localai 是一个开源 AI 引擎,可在用户自有基础设施上运行涵盖文本、音频、图像和视频的多模态模型,且不强制要求 GPU。它提供与 OpenAI、Anthropic 和 ElevenLabs API 兼容的接口,便于已有应用对接。
oobabooga/textgen
textgen 是一个用于在本地运行大型语言模型的桌面应用程序,支持文本、视觉和工具调用功能,并提供与 OpenAI/Anthropic 兼容的 API。该应用程序运行时无任何遥测,确保数据边界仅限本地。
microsoft/qlib
Qlib 是一个面向量化投资研究的模块化框架,覆盖从数据处理到模型训练再到回测的完整流程。它通过 qrun 工具自动串联整个工作流,支持包括强化学习在内的多种机器学习范式。
coqui-ai/TTS
coqui-ai/tts 是一个用于文本转语音生成的深度学习工具包,提供覆盖 1100 种以上语言的预训练模型,并具备模型训练与声音克隆能力。用户可通过命令行、Python 库或自带 Web 服务器在本地进行语音合成与开发。
Kong/kong
kong 是一个云原生、平台无关且可扩展的网关,通过插件系统提供扩展性。它集中处理 API、LLM 和 MCP 流量,为微服务架构提供统一的编排与代理层。
janhq/jan
janhq/jan 是一款面向本地大模型交互的桌面应用,可下载并运行来自 HuggingFace 的兼容模型,也可按需连接多家云模型服务。它适合希望通过图形界面使用本地模型,同时保留云端模型与本地接口扩展路径的个人用户和开发者。
ray-project/ray
ray 是一个统一的 Python 与 AI 应用分布式框架,旨在将计算密集型机器学习负载从单机开发环境扩展到集群。它提供无状态任务、有状态 Actor 和不可变对象的分布式抽象。
gradio-app/gradio
gradio 让开发者仅用 Python 即可为机器学习模型或任意 Python 函数构建可交互的 Web 演示与应用,无需编写 JavaScript、CSS 或处理 Web 托管。
Alishahryar1/free-claude-code
free-claude-code 是一个本地代理工具,允许 Claude Code、Codex、Pi 及其 IDE 扩展通过自有的提供商代理运行。它支持在本地管理界面中配置和验证多达 25 个云端或本地模型提供商。
chatanywhere/GPT_API_free
gpt_api_free 提供免费和付费两种方式,使用户无需 VPN 即可通过统一的 OpenAI 协议访问多种主流大语言模型 API。该项目为个人学习、教育或非营利研究提供了低门槛的 API 接入途径,但免费密钥受每日请求次数和 Token 数量的限制。
TencentARC/GFPGAN
tencentarc/gfpgan 面向真实世界场景中的盲人脸恢复,使用预训练人脸 GAN 所封装的人脸先验进行修复。项目可在本地运行,提供训练代码,并提供不要求 CUDA 扩展的 Clean 版本。
google-ai-edge/mediapipe
mediapipe 提供跨平台库与框架,用于在设备端直接应用、定制和部署机器学习解决方案,输入数据无需发送至外部服务器。该项目支持 Android、iOS、Web、Python 和 C++ 平台集成。
1Panel-dev/1Panel
1panel-dev/1panel 是一款开源的 Linux VPS 控制面板,提供 Web 图形界面用于管理服务器、部署网站及管理 Docker 容器,并集成了 AI 智能体运行时能力。用户无需记住 CLI 命令即可完成服务器和容器栈的日常管理工作。
musistudio/claude-code-router
musistudio/claude-code-router 是一个本地控制平面,提供单一且稳定的本地端点,用于在多个编码代理和提供商之间管理配置、模型、路由规则和工具。它旨在应对在多个代理和提供商之间切换模型时独立维护配置容易中断的问题。
shiyu-coder/Kronos
Kronos 是一个面向金融 K 线(蜡烛图)序列的预训练基础模型,采用分层分词器和自回归 Transformer 架构,旨在支持多种量化任务。该项目自述在超过 45 个全球交易所的数据上进行了预训练,并称自身为首个针对金融 K 线的开源基础模型。
OpenBMB/VoxCPM
voxcpm 是一个无 tokenizer 的端到端文本转语音模型,支持 30 种语言并直接输出 48kHz 音频,提供基于自然语言描述的语音设计及声音克隆能力。项目支持本地运行。
mckaywrigley/chatbot-ui
mckaywrigley/chatbot-ui 是一个开源 AI 聊天应用,可连接任意 AI 模型,并可在本地或云端部署。选型关键在于:它提供网页聊天界面,但数据库与认证后端需要 Supabase,且运行时仍需接入模型。
fishaudio/fish-speech
fish-speech 是一个支持 80 多种语言的文本转语音系统,提供短样本语音克隆与细粒度情感标签控制能力。该项目在 Seed-TTS Eval 基准测试中取得了包括闭源系统在内的所有受评模型中的最低词错误率(WER)。
datawhalechina/self-llm
self-llm 是一个面向中文初学者的开源大语言模型教程项目,覆盖 50+ 主流开源大模型的环境配置、部署、应用与微调全流程。教程适配多种硬件平台,以文本和 Jupyter Notebook 形式提供可跟练的学习路径。
onyx-dot-app/onyx
onyx 是一个可自托管的大语言模型应用层与聊天界面,为私有部署环境提供 RAG、联网搜索和深度研究等能力。该项目提供 50 种以上索引连接器以及可按需选择的轻量部署模式。
sgl-project/sglang
sglang 是一个面向大语言模型和多模态模型的服务框架,通过 RadixAttention、零开销调度器和连续批处理等运行时特性,提供低延迟、高吞吐的推理能力,并具备多硬件平台兼容性。
eugeneyan/applied-ml
eugeneyan/applied-ml 是一份面向生产实践的机器学习资料索引,汇集论文和工程技术博客,并按领域及机器学习生命周期阶段组织。它适合用真实案例快速定位某类 ML 问题的实现经验与结果线索,而非提供可直接运行的 ML 框架。
cheahjs/free-llm-api-resources
cheahjs/free-llm-api-resources 是面向开发者和研究者的免费大语言模型 API 资源目录,集中整理可免费使用或提供试用额度的服务、可用模型及限制。它适合用于候选服务初筛,不是模型推理或 API 托管服务。