AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
模型运行
浏览当前公开快照中“模型运行”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
open-webui/open-webui
— open-webui 是一个可自托管、设计为支持离线运行的可扩展 AI 平台,提供 Web 界面管理 Ollama 本地模型与 OpenAI 兼容 API,并集成了检索增强生成(RAG)等丰富功能。
ollama/ollama
— ollama/ollama 提供了一种在本地运行开源大语言模型的简便方式,支持通过 CLI、REST API 和编程语言库进行交互。
huggingface/transformers
— transformers 是覆盖文本、视觉、音频、视频和多模态的统一模型定义库。它通过提供低门槛的统一 API、支持共享已训练权重以减少算力消耗,并允许在 PyTorch/JAX/TF2.0 框架间迁移模型来提供服务。
ggml-org/llama.cpp
— llama.cpp 是一个纯 C/C++ 实现的 LLM 推理引擎,无任何外部依赖,支持通过整数(1.5-8-bit)量化在本地或云端硬件上运行模型推理。它提供了覆盖 CLI 交互、文本生成、模型量化与多模态处理的核心工具链。
Alishahryar1/free-claude-code
— free-claude-code 是一个本地代理工具,允许 Claude Code、Codex、Pi 及其 IDE 扩展通过自有的提供商代理运行。它支持在本地管理界面中配置和验证多达 25 个云端或本地模型提供商。
jingyaogong/minimind
— minimind 是一个面向个人学习者的开源教育项目,提供从零开始用 PyTorch 训练 64M 参数大型语言模型的全流程代码与配套数据集。项目覆盖预训练到强化学习对齐的完整环节,旨在降低理解 LLM 的门槛。
unslothai/unsloth
— unsloth 是一个支持通过 Web UI 和代码库在本地运行与训练文本、音频、嵌入及视觉模型的应用,旨在以更快的速度和更低的显存占用完成大模型任务。它同时提供数据集自动构建、模型导出和训练过程监控等支持性能力。
vllm-project/vllm
— vllm 是一个面向大语言模型的高吞吐量且具有内存效率的推理与服务引擎,适合需要高效部署 LLM 的开发者和运维团队。
lyogavin/airllm
— airllm 是一个通过逐层加载策略降低大语言模型推理显存占用的 Python 库,使 70B 级别模型在单张约 4GB 显存的 GPU 上无需量化即可运行。其核心机制是以磁盘加载换取显存节省,因此主要适用于对吞吐量要求不高的本地环境。
tashfeenahmed/freellmapi
— freellmapi 是一个将多家 LLM 提供商免费额度聚合在单一 OpenAI 兼容 /v1 端点后面的路由代理服务,提供智能路由、自动故障转移和密钥加密存储。它面向个人实验与学习场景,支持自托管和本地运行。
cactus-compute/needle
— needle 是一个拥有 2600 万参数的注意力网络模型,用于在手机、可穿戴设备、智能家居设备等小型消费设备上运行 AI 函数调用。该模型大小为 14MB,在 Cactus 上可实现每秒 6000 token 的预填充速度,并支持本地微调。
FareedKhan-dev/kimi-k3-in-c
— fareedkhan-dev/kimi-k3-in-c 是一个用纯 C99 编写的推理引擎,通过从磁盘流式加载非驻留专家,在单 CPU 和 8.24 GB RAM 的条件下运行 2.78 万亿参数的混合专家模型,输出与全驻留运行时字节一致。
BerriAI/litellm
— litellm 是一个开源 AI 网关与 Python SDK,以统一的 OpenAI 格式代理对 100 多种大语言模型的调用,并提供成本追踪、负载均衡、缓存和管理面板。
AUTOMATIC1111/stable-diffusion-webui
— stable-diffusion-webui 是一个基于 Gradio 的 Stable Diffusion Web 界面,提供文生图、图生图、模型训练等功能。该项目提供安装脚本并支持在 4GB 显存的显卡上运行,适合需要在本地运行和管理图像生成的用户。
google-research/timesfm
— TimesFM 是一个预训练的 decoder-only 时间序列预测基础模型,旨在为时间序列预测提供稳健的解决方案。
rasbt/LLMs-from-scratch
— llms-from-scratch 是一份基于 PyTorch 从零开始构建小型可用大语言模型的分步教程资源,涵盖数据准备、注意力机制、预训练和微调。该项目通过逐行编写代码的教学方式,帮助开发者深入理解 LLM 的内部工作原理。
sgl-project/sglang
— sglang 是一个面向大语言模型和多模态模型的服务框架,通过 RadixAttention、零开销调度器和连续批处理等运行时特性,提供低延迟、高吞吐的推理能力,并具备多硬件平台兼容性。
drumih/turbo-fieldfare
— turbo-fieldfare 是一个用于在 Apple Silicon Mac 上本地运行大语言模型的自定义 Swift + Metal 运行时,通过从 SSD 流式加载所需的专家模块,使 Gemma 4 26B-A4B 模型能在约 2 GB 内存中运行。
jamiepine/voicebox
— voicebox 是一个本地优先的语音输入输出栈,将语音克隆、多引擎 TTS、全局听写与 MCP Agent 语音输出整合在同一桌面应用中。它面向希望替代云端语音服务、实现数据不出本地机器的开发者和创作者。
ChatGPTNextWeb/NextChat
— nextchat 是一款轻量、跨平台的多模型聊天客户端,适合希望快速搭建个人 AI 助手并将会话数据保存在浏览器本地的用户。它的优势是部署和切换模型提供方较方便,但使用前仍需确认外部 API 成本,且本地知识库尚未正式可用。
decolua/9router
— 9router 是一个智能路由器,将 AI 编程工具连接到免费或低价模型,通过跨层级自动回退避免中断,并压缩工具输出以节省 20-40% 的 token。它解决了订阅额度闲置、速率限制打断编程会话以及工具输出消耗过多 token 的问题。
jundot/omlx
— omlx 是面向 Apple Silicon 的本地 LLM 推理服务,核心特征是分层 KV 缓存(热数据驻留 RAM、冷数据卸载至 SSD)在服务重启后仍可恢复,并通过 macOS 菜单栏应用和 Web 管理面板进行管理。兼容 OpenAI 与 Anthropic API 格式,支持并发批处理与多模型同服。
chatanywhere/GPT_API_free
— gpt_api_free 提供免费和付费两种方式,使用户无需 VPN 即可通过统一的 OpenAI 协议访问多种主流大语言模型 API。该项目为个人学习、教育或非营利研究提供了低门槛的 API 接入途径,但免费密钥受每日请求次数和 Token 数量的限制。
hiyouga/LlamaFactory
— llamafactory 为 100 多种大语言模型和视觉语言模型提供统一微调框架,支持通过零代码 CLI 和 Web UI 完成训练,涵盖从持续预训练到 DPO/PPO 等多种算法与量化调优方案。
shiyu-coder/Kronos
— Kronos 是一个面向金融 K 线(蜡烛图)序列的预训练基础模型,采用分层分词器和自回归 Transformer 架构,旨在支持多种量化任务。该项目自述在超过 45 个全球交易所的数据上进行了预训练,并称自身为首个针对金融 K 线的开源基础模型。
ultralytics/ultralytics
— ultralytics 提供覆盖检测、分割、分类、姿态估计和目标追踪的实时计算机视觉模型开发与部署能力,通过统一的 CLI 和 Python API 交付 YOLO 模型。模型会在首次使用时自动下载,适合需要快速上手和迭代的视觉任务场景。
microsoft/qlib
— Qlib 是一个面向量化投资研究的模块化框架,覆盖从数据处理到模型训练再到回测的完整流程。它通过 qrun 工具自动串联整个工作流,支持包括强化学习在内的多种机器学习范式。
2noise/ChatTTS
— ChatTTS 是一款专为对话场景优化的文本转语音模型,支持多说话人及对笑声、停顿等细粒度韵律特征的控制。该模型目前仅支持学术研究用途,禁止商用。
Zackriya-Solutions/meetily
— meetily 是一款隐私优先的本地 AI 会议助手,能够完全在设备端捕获音频并完成实时转写与摘要,无需将数据发送至云端。它支持使用 Whisper 或 Parakeet 等模型进行本地推理,适合需要严格数据主权的会议记录场景。
OpenBMB/VoxCPM
— voxcpm 是一个无 tokenizer 的端到端文本转语音模型,支持 30 种语言并直接输出 48kHz 音频,提供基于自然语言描述的语音设计及声音克隆能力。项目支持本地运行。
ggml-org/whisper.cpp
— whisper.cpp 是一个以纯 C/C++ 实现的 OpenAI Whisper 模型推理库,用于在应用程序中集成语音识别功能。该实现无额外依赖,且运行时零内存分配,支持多种操作系统与硬件后端。
songquanpeng/one-api
— one-api 将多个 LLM 提供商的访问统一到标准 OpenAI API 格式之下,提供密钥管理与二次分发能力。它通过多渠道路由分发请求,帮助开发者和团队统一接口调用。
Nasiko-Labs/nasiko
— nasiko 是一个面向生产环境的 AI 代理控制平面,将多代理的部署、智能路由、可观测性和生命周期管理整合在一个平台中。它通过 Kong 网关和 LangChain 驱动的路由机制,为开发团队提供代理规模扩展时的基础设施支持。
xtekky/gpt4free
— gpt4free 是一个聚合多种 LLM 与媒体生成提供方的开源项目,提供本地 GUI、OpenAI 兼容 REST API 及 Python/JavaScript 客户端。它通过多提供方适配器将请求路由至不同的外部或本地服务,降低了对单一服务的依赖。
mudler/LocalAI
— localai 是一个开源 AI 引擎,可在用户自有基础设施上运行涵盖文本、音频、图像和视频的多模态模型,且不强制要求 GPU。它提供与 OpenAI、Anthropic 和 ElevenLabs API 兼容的接口,便于已有应用对接。
keras-team/keras
— keras 是一个高级深度学习框架,支持在 JAX、TensorFlow、PyTorch 和 OpenVINO 后端上构建、训练和推理模型,旨在提供易调试的开发体验并规避框架锁定。
agentscope-ai/QwenPaw
— qwenpaw 是面向个人使用的 AI 助手,支持本地、自托管与托管形态,并提供持久记忆、工具执行、即时通信渠道接入和代码工作界面。它更适合希望在同一套助手后端中组合本地模型、长期上下文与多种交互入口的用户。
index-tts/index-tts
— index-tts/index-tts 适合需要本地自托管、零样本声音克隆,并希望将音色与情绪分开控制的开发团队。其优势是控制路径明确,但采用前需确认 NVIDIA GPU、CUDA 12.8 及以上环境和模型下载流程。
Crosstalk-Solutions/project-nomad
— Project Nomad 是一台完全离线优先、自包含的知识与教育服务器,集成了工具和 AI 能力,专为互联网中断或离网场景下的信息访问需求设计。
ultralytics/yolov5
— ultralytics/yolov5 是一个基于 PyTorch 的视觉 AI 模型,支持目标检测、实例分割和图像分类任务,可用于快速训练、推理和部署。
×