图像视觉 开源项目
浏览当前公开快照中经过筛选的 图像视觉 AI 开源项目,并进入项目详情查看适用场景、部署条件、限制与核验证据。
当前展示 40 个可索引项目。
Robbyant/lingbot-map
robbyant/lingbot-map 面向图像或视频流的三维场景重建,适合需要研究流式重建、长序列推理与点云可视化,并能自行准备 CUDA 环境和模型权重的团队。它提供交互查看、离线漫游视频渲染及基准评测工具,但显存占用、缓存长度和训练距离范围会影响选型。
AUTOMATIC1111/stable-diffusion-webui
stable-diffusion-webui 是一个基于 Gradio 的 Stable Diffusion Web 界面,提供文生图、图生图、模型训练等功能。该项目提供安装脚本并支持在 4GB 显存的显卡上运行,适合需要在本地运行和管理图像生成的用户。
Comfy-Org/ComfyUI
结论:comfy-org/comfyui 适合希望通过节点图精细组织生成式工作流、同时保留本地离线与外部服务选择空间的创作者。它覆盖图像、视频、三维模型和音频生成,但采用自定义节点或面向共享生产环境部署前,需要核查版本兼容性与证书配置。
huggingface/diffusers
diffusers 是一个面向预训练扩散模型(覆盖图像、音频、视频)的模块化工具箱,提供推理流水线、可互换噪声调度器和可组合的预训练模型组件,基于 PyTorch 构建。它强调可用性优先于性能、可定制优先于抽象封装,适合需要在代码层面灵活控制生成与训练流程的开发者和研究人员。
opencv/opencv
opencv 是一个覆盖计算机视觉、图像处理和深度学习领域的开源函数库,定位为计算机视觉开发的基础设施。该项目以库形式提供算法集合,供开发者在本地集成使用。
ultralytics/ultralytics
ultralytics 提供覆盖检测、分割、分类、姿态估计和目标追踪的实时计算机视觉模型开发与部署能力,通过统一的 CLI 和 Python API 交付 YOLO 模型。模型会在首次使用时自动下载,适合需要快速上手和迭代的视觉任务场景。
ultralytics/yolov5
ultralytics/yolov5 是一个基于 PyTorch 的视觉 AI 模型,支持目标检测、实例分割和图像分类任务,可用于快速训练、推理和部署。
ageitgey/face_recognition
face_recognition 提供了基于 Python 库和命令行的人脸检测、特征点定位与识别能力,其底层依托 dlib 深度学习模型,在 Labeled Faces in the Wild 基准上准确率达 99.38%。
roboflow/supervision
supervision 为计算机视觉应用提供可复用的数据加载、检测、可视化等构建块,支持通过连接器接入多种主流分类、检测或分割模型。它帮助开发者减少重复代码编写,使其能将精力集中在应用逻辑上。
photoprism/photoprism
photoprism/photoprism 是一款可自托管的照片与视频管理应用,通过自动标签和人脸识别帮助用户整理媒体文件,以便于搜索和重新发现。
TencentARC/GFPGAN
tencentarc/gfpgan 面向真实世界场景中的盲人脸恢复,使用预训练人脸 GAN 所封装的人脸先验进行修复。项目可在本地运行,提供训练代码,并提供不要求 CUDA 扩展的 Clean 版本。
BVLC/caffe
Caffe 是一个以表达力、速度和模块化为核心设计目标的深度学习框架,配有教程、参考模型和安装指引。适合需要快速实验和模块化开发的深度学习研究者和开发者。
lllyasviel/ControlNet
ControlNet 是一种神经网络结构,通过为文本到图像扩散模型添加额外的空间条件来实现控制,同时不会破坏已有的生产级基础模型。
linshenkx/prompt-optimizer
prompt-optimizer 是一款 AI 提示词优化工具,提供提示词分析、测试、评估与多模型集成功能。采用纯客户端处理架构,数据直接与 AI 服务提供商交互,不经过中间服务器。
fastai/fastai
fastai 提供高层与低层双层 API,让用户能以约 5 行代码快速达到先进深度学习成果,同时保持灵活性、易用性与性能。它覆盖图像、文本、表格和推荐系统场景,适用于研究原型与快速实验。
invoke-ai/InvokeAI
InvokeAI 为专业创作者和爱好者提供本地托管的 Web 界面,支持使用生成式 AI 模型进行视觉媒体的生成与迭代。项目包含统一的画布工具和基于节点的工作流管理功能。
ATH-MaaS/Pixelle-Video
ath-maas/pixelle-video 面向希望从主题或脚本生成短视频、且不需要细粒度手工剪辑的创作者。它覆盖脚本、图像或视频素材、配音、背景音乐与成片合成,并允许通过不同服务或工作流替换部分生成组件。
lucidrains/vit-pytorch
vit-pytorch 提供 Vision Transformer 及多种相关架构的 PyTorch 实现,用于图像分类场景。该库将多种视觉 Transformer 变体与预训练任务集中在一个 Python 包中,便于研究者和开发者快速开展实验。
junyanz/pytorch-CycleGAN-and-pix2pix
提供 CycleGAN 与 pix2pix 的 PyTorch 实现,支持非配对和配对图像到图像翻译模型的训练、测试与预训练模型推理。其结果与原始 Torch 实现相当或更好,适合图像翻译研究、实验与定制开发。
Anil-matcha/Open-Generative-AI
open-generative-ai 是一个可自托管的生成式 AI 工作室,支持通过 200 多个模型生成图像、视频和口型同步内容,且不设内容过滤机制。该工具提供云端 API 调用与桌面端本地推理两种运行路径,适用于无需代码基础的媒体生成场景。
spmallick/learnopencv
spmallick/learnopencv 是一个为计算机视觉、深度学习和 AI 概念提供实践性、可复用代码示例的开源代码集合,代码与配套的教育性博客文章紧密结合。
microsoft/unilm
microsoft/unilm 提供一组预训练基础模型、架构与工具,覆盖 NLP、视觉、语音及文档 AI 等多种任务。其中 LayoutLM 是面向文档 AI 的多模态(文本 + 版面/格式 + 图像)基础模型,可用于扫描文档、PDF 等场景。
apple/ml-stable-diffusion
ml-stable-diffusion 提供将 PyTorch Stable Diffusion 模型转换为 Core ML 格式的 Python 工具,以及用于在 Apple Silicon 设备上进行端侧图像生成的 Swift 包。
pytorch/vision
vision 为 PyTorch 提供计算机视觉任务所需的核心组件,包括公开数据集的下载与准备、常用图像变换以及预训练模型架构。
deepseek-ai/Janus
deepseek-ai/janus 通过将视觉编码解耦为独立的理解和生成路径,解决了统一架构中多模态理解与图像生成之间的冲突。它使用单个统一 Transformer,在保持高灵活性的同时,能够匹配或超越任务专用模型的表现。
lukas-blecher/LaTeX-OCR
latex-ocr 是一个基于学习的系统,可将数学公式图像转换为 LaTeX 代码,并提供 CLI、GUI 和 Python 库调用等使用方式。
camenduru/stable-diffusion-webui-colab
stable-diffusion-webui-colab 适合希望通过 Google Colab 使用 Stable Diffusion WebUI、又不准备搭建本地环境的图像与视频创作者。它的核心价值是提供已配置模型、扩展和相关资源的笔记本集合,但不适合作为离线或本地自托管方案。
AliaksandrSiarohin/first-order-model
first-order-model 提供源代码和预训练检查点,通过将驱动视频中的动作迁移到静止源图像来实现图像动画,支持在多种数据集上进行动作重定向。
aleju/imgaug
imgaug 是一个 Python 库,用于对图像进行增强以服务于机器学习项目,可将一组输入图像转换为一组数量更多、经过轻微改变的图像。
Tencent-Hunyuan/Hunyuan3D-2
tencent-hunyuan/hunyuan3d-2 是一个开源 3D 合成系统,可从图像生成和处理高分辨率、带纹理的 3D 资产。它也提供本地 API 服务、可托管的 Gradio Web 应用与 Blender 插件等使用入口。
davidsandberg/facenet
davidsandberg/facenet 是一个基于 TensorFlow 的 FaceNet 实现,提供预训练模型和用于训练人脸识别分类器的工具。该项目支持人脸识别与人脸聚类任务,并包含在 LFW 基准上验证模型准确度的脚本。
mlfoundations/open_clip
CLIP 的开源实现,支持多种多模态架构的训练与评估。提供基于 Python 的库,可通过 PyPI 包 open_clip_torch 使用。
waooAI/waoowaoo
waoowaoo 是一款 AI 视频制作工具,能够将小说文本转化为分镜、角色、场景和完整的视频。该项目支持通过 Docker Compose 进行本地部署,并提供中文与英文界面。
YouMind-OpenLab/awesome-nano-banana-pro-prompts
awesome-nano-banana-pro-prompts 是一个针对 Google Nano Banana Pro 图像生成模型的提示词库,收录了 14,814 条带有预览图的精选提示词。该项目还提供了在线画廊与多语言文档,方便用户检索和复用提示词模板。
jacobgil/pytorch-grad-cam
pytorch-grad-cam 是一个面向 PyTorch 计算机视觉模型的可解释 AI 方法库,通过 GradCAM、ScoreCAM 等像素归因方法生成类激活图,帮助用户可视化并诊断模型预测中起关键作用的像素区域。
zai-org/CogVideo
cogvideo 是一个开源的文本到视频与图像到视频扩散模型项目,提供推理优化与社区微调支持。该项目支持通过提示词或输入背景图像来生成视频内容。
junyanz/CycleGAN
CycleGAN 是一种用于在没有配对输入输出样本的情况下学习图像到图像转换的算法实现,支持使用预训练模型生成图像或在自有数据集上训练新模型。
modelscope/DiffSynth-Studio
diffsynth-studio 是一个面向 Diffusion 模型的推理与训练统一框架,旨在降低扩散模型技术探索门槛。该框架提供重新设计的推理与训练管线,支持显存自动管理和 CPU Offload 训练。
extreme-assistant/CVPR2024-Paper-Code-Interpretation
cvpr2024-paper-code-interpretation 是一个精选资源列表仓库,汇集了 CVPR 2017 至 2024 年度的论文、代码、论文解读和直播分享链接,帮助用户快速定位相关学术资源。
steven2358/awesome-generative-ai
steven2358/awesome-generative-ai 是一个遵循 Awesome list 格式的生成式 AI 项目与服务精选列表,按应用领域分类整理,涵盖文本、编程、智能体、图像、视频、音频和学习资源等类别。