AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
图像视觉
浏览当前公开快照中“图像视觉”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
Comfy-Org/ComfyUI
— 结论:comfy-org/comfyui 适合希望通过节点图精细组织生成式工作流、同时保留本地离线与外部服务选择空间的创作者。它覆盖图像、视频、三维模型和音频生成,但采用自定义节点或面向共享生产环境部署前,需要核查版本兼容性与证书配置。
freestylefly/awesome-gpt-image-2
— awesome-gpt-image-2 是一个专注于将 AI 绘画提示词工程化的资源库,把零散的图像生成示例转化为可复用、可组合的结构化模块。项目提供了 520 个案例库,并配备了在线可视画廊和风格库智能体技能。
AUTOMATIC1111/stable-diffusion-webui
— stable-diffusion-webui 是一个基于 Gradio 的 Stable Diffusion Web 界面,提供文生图、图生图、模型训练等功能。该项目提供安装脚本并支持在 4GB 显存的显卡上运行,适合需要在本地运行和管理图像生成的用户。
huggingface/diffusers
— diffusers 是一个面向预训练扩散模型(覆盖图像、音频、视频)的模块化工具箱,提供推理流水线、可互换噪声调度器和可组合的预训练模型组件,基于 PyTorch 构建。它强调可用性优先于性能、可定制优先于抽象封装,适合需要在代码层面灵活控制生成与训练流程的开发者和研究人员。
opencv/opencv
— opencv 是一个覆盖计算机视觉、图像处理和深度学习领域的开源函数库,定位为计算机视觉开发的基础设施。该项目以库形式提供算法集合,供开发者在本地集成使用。
Anil-matcha/Open-Generative-AI
— open-generative-ai 是一个可自托管的生成式 AI 工作室,支持通过 200 多个模型生成图像、视频和口型同步内容,且不设内容过滤机制。该工具提供云端 API 调用与桌面端本地推理两种运行路径,适用于无需代码基础的媒体生成场景。
ultralytics/ultralytics
— ultralytics 提供覆盖检测、分割、分类、姿态估计和目标追踪的实时计算机视觉模型开发与部署能力,通过统一的 CLI 和 Python API 交付 YOLO 模型。模型会在首次使用时自动下载,适合需要快速上手和迭代的视觉任务场景。
linshenkx/prompt-optimizer
— prompt-optimizer 是一款 AI 提示词优化工具,提供提示词分析、测试、评估与多模型集成功能。采用纯客户端处理架构,数据直接与 AI 服务提供商交互,不经过中间服务器。
helloianneo/ian-xiaohei-illustrations
— helloianneo/ian-xiaohei-illustrations 适合希望把中文文章中的关键认知点转成“小黑”手绘风配图,并接受依赖 Codex 与图像生成模型的内容创作者。它不适合需要矢量源文件、演示文稿成品、复杂信息图或商业品牌主视觉的团队。
roboflow/supervision
— supervision 为计算机视觉应用提供可复用的数据加载、检测、可视化等构建块,支持通过连接器接入多种主流分类、检测或分割模型。它帮助开发者减少重复代码编写,使其能将精力集中在应用逻辑上。
ultralytics/yolov5
— ultralytics/yolov5 是一个基于 PyTorch 的视觉 AI 模型,支持目标检测、实例分割和图像分类任务,可用于快速训练、推理和部署。
deepfakes/faceswap
— faceswap 是一款面向学习和实验目的的开源深度学习换脸工具,支持从图像和视频中提取人脸、训练模型并完成换脸转换。用户无需具备高级 AI 专业背景即可通过命令行或图形界面使用。
ageitgey/face_recognition
— face_recognition 提供了基于 Python 库和命令行的人脸检测、特征点定位与识别能力,其底层依托 dlib 深度学习模型,在 Labeled Faces in the Wild 基准上准确率达 99.38%。
basketikun/infinite-canvas
— infinite-canvas 是一个开源的无限画布工作台,将 AI 图像生成、参考图编辑、对话助手和提示词库整合在单一可视化界面中,支持通过浏览器前端直接连接 OpenAI 兼容接口进行多种媒体生成。
photoprism/photoprism
— photoprism/photoprism 是一款可自托管的照片与视频管理应用,通过自动标签和人脸识别帮助用户整理媒体文件,以便于搜索和重新发现。
wiltodelta/remove-ai-watermarks
— wiltodelta/remove-ai-watermarks 是面向 AI 生成图片的本地水印清理工具,适合需要通过命令行或 Python 统一处理可见水印、不可见水印与元数据的用户。它不应被视为移除付费或受版权保护素材水印的通用工具。
invoke-ai/InvokeAI
— InvokeAI 为专业创作者和爱好者提供本地托管的 Web 界面,支持使用生成式 AI 模型进行视觉媒体的生成与迭代。项目包含统一的画布工具和基于节点的工作流管理功能。
TencentARC/GFPGAN
— tencentarc/gfpgan 面向真实世界场景中的盲人脸恢复,使用预训练人脸 GAN 所封装的人脸先验进行修复。项目可在本地运行,提供训练代码,并提供不要求 CUDA 扩展的 Clean 版本。
lllyasviel/ControlNet
— ControlNet 是一种神经网络结构,通过为文本到图像扩散模型添加额外的空间条件来实现控制,同时不会破坏已有的生产级基础模型。
BVLC/caffe
— Caffe 是一个以表达力、速度和模块化为核心设计目标的深度学习框架,配有教程、参考模型和安装指引。适合需要快速实验和模块化开发的深度学习研究者和开发者。
waooAI/waoowaoo
— waoowaoo 是一款 AI 视频制作工具,能够将小说文本转化为分镜、角色、场景和完整的视频。该项目支持通过 Docker Compose 进行本地部署,并提供中文与英文界面。
fastai/fastai
— fastai 提供高层与低层双层 API,让用户能以约 5 行代码快速达到先进深度学习成果,同时保持灵活性、易用性与性能。它覆盖图像、文本、表格和推荐系统场景,适用于研究原型与快速实验。
YouMind-OpenLab/awesome-gpt-image-2
— youmind-openlab/awesome-gpt-image-2 是面向 GPT Image 2 的分类提示词资料库,而不是图像生成工具。适合需要检索、复用和调整图像提示词的创作者,不适合希望直接运行模型或生成图像的用户。
lucidrains/vit-pytorch
— vit-pytorch 提供 Vision Transformer 及多种相关架构的 PyTorch 实现,用于图像分类场景。该库将多种视觉 Transformer 变体与预训练任务集中在一个 Python 包中,便于研究者和开发者快速开展实验。
junyanz/pytorch-CycleGAN-and-pix2pix
— 提供 CycleGAN 与 pix2pix 的 PyTorch 实现,支持非配对和配对图像到图像翻译模型的训练、测试与预训练模型推理。其结果与原始 Torch 实现相当或更好,适合图像翻译研究、实验与定制开发。
spmallick/learnopencv
— spmallick/learnopencv 是一个为计算机视觉、深度学习和 AI 概念提供实践性、可复用代码示例的开源代码集合,代码与配套的教育性博客文章紧密结合。
Tencent-Hunyuan/Hunyuan3D-2
— tencent-hunyuan/hunyuan3d-2 是一个开源 3D 合成系统,可从图像生成和处理高分辨率、带纹理的 3D 资产。它也提供本地 API 服务、可托管的 Gradio Web 应用与 Blender 插件等使用入口。
microsoft/unilm
— microsoft/unilm 提供一组预训练基础模型、架构与工具,覆盖 NLP、视觉、语音及文档 AI 等多种任务。其中 LayoutLM 是面向文档 AI 的多模态(文本 + 版面/格式 + 图像)基础模型,可用于扫描文档、PDF 等场景。
×