视频技术 开源项目
浏览当前公开快照中经过筛选的 视频技术 AI 开源项目,并进入项目详情查看适用场景、部署条件、限制与核验证据。
当前展示 25 个可索引项目。
Robbyant/lingbot-map
robbyant/lingbot-map 面向图像或视频流的三维场景重建,适合需要研究流式重建、长序列推理与点云可视化,并能自行准备 CUDA 环境和模型权重的团队。它提供交互查看、离线漫游视频渲染及基准评测工具,但显存占用、缓存长度和训练距离范围会影响选型。
bradautomates/claude-video
claude-video 以自包含技能单元形式,让 AI 助手通过下载视频、提取帧和转录音频来获取视频内容。该技能支持在多个代理宿主中运行,依赖 ffmpeg 和 yt-dlp 处理视频,并可通过可选的 Groq 或 OpenAI API 进行音频转录。
Comfy-Org/ComfyUI
结论:comfy-org/comfyui 适合希望通过节点图精细组织生成式工作流、同时保留本地离线与外部服务选择空间的创作者。它覆盖图像、视频、三维模型和音频生成,但采用自定义节点或面向共享生产环境部署前,需要核查版本兼容性与证书配置。
harry0703/MoneyPrinterTurbo
moneyprinterturbo 面向希望从主题或关键词生成短视频的创作者,可串联脚本、素材匹配、配音、字幕与视频合成。它更适合能够自行部署并配置模型及语音服务凭据的团队,而不是需要全托管服务的非技术用户。
huggingface/diffusers
diffusers 是一个面向预训练扩散模型(覆盖图像、音频、视频)的模块化工具箱,提供推理流水线、可互换噪声调度器和可组合的预训练模型组件,基于 PyTorch 构建。它强调可用性优先于性能、可定制优先于抽象封装,适合需要在代码层面灵活控制生成与训练流程的开发者和研究人员。
opencv/opencv
opencv 是一个覆盖计算机视觉、图像处理和深度学习领域的开源函数库,定位为计算机视觉开发的基础设施。该项目以库形式提供算法集合,供开发者在本地集成使用。
ultralytics/ultralytics
ultralytics 提供覆盖检测、分割、分类、姿态估计和目标追踪的实时计算机视觉模型开发与部署能力,通过统一的 CLI 和 Python API 交付 YOLO 模型。模型会在首次使用时自动下载,适合需要快速上手和迭代的视觉任务场景。
ultralytics/yolov5
ultralytics/yolov5 是一个基于 PyTorch 的视觉 AI 模型,支持目标检测、实例分割和图像分类任务,可用于快速训练、推理和部署。
roboflow/supervision
supervision 为计算机视觉应用提供可复用的数据加载、检测、可视化等构建块,支持通过连接器接入多种主流分类、检测或分割模型。它帮助开发者减少重复代码编写,使其能将精力集中在应用逻辑上。
calesthio/OpenMontage
openmontage 是一套端到端视频制作系统,通过外部 AI 编程助手自动化从构思到成片的流程化制作,支持真实素材或生成式视频组装,并带有质量校验环节。它不绑定特定供应商,将研究、提案、脚本、场景规划、资产生成、剪辑和合成编排为结构化阶段。
heygen-com/hyperframes
hyperframes 是一个将 HTML/CSS 和可寻址动画编程式渲染为确定性 MP4 视频的框架,专为自动化流水线和 AI 智能体设计。它无需构建步骤,且无按次渲染费用。
ATH-MaaS/Pixelle-Video
ath-maas/pixelle-video 面向希望从主题或脚本生成短视频、且不需要细粒度手工剪辑的创作者。它覆盖脚本、图像或视频素材、配音、背景音乐与成片合成,并允许通过不同服务或工作流替换部分生成组件。
Anil-matcha/Open-Generative-AI
open-generative-ai 是一个可自托管的生成式 AI 工作室,支持通过 200 多个模型生成图像、视频和口型同步内容,且不设内容过滤机制。该工具提供云端 API 调用与桌面端本地推理两种运行路径,适用于无需代码基础的媒体生成场景。
spmallick/learnopencv
spmallick/learnopencv 是一个为计算机视觉、深度学习和 AI 概念提供实践性、可复用代码示例的开源代码集合,代码与配套的教育性博客文章紧密结合。
jianchang512/pyvideotrans
pyvideotrans 将语音识别、字幕翻译、多角色配音和音视频合成串联为一条完整流水线,同时支持本地离线部署和多种主流在线 API。Windows 用户可直接使用预打包程序免配置运行。
Huanshere/VideoLingo
videolingo 是一条自动化视频翻译与配音流水线,能够生成单行字幕并合成配音视频。它通过 NLP 和 AI 技术处理视频的转录、翻译、对齐和配音环节。
lllyasviel/FramePack
framepack 是一个视频扩散项目,通过将帧上下文压缩为恒定长度,使生成视频的工作量与视频长度无关。该项目可在笔记本电脑 GPU 上使用 13B 模型处理大量帧,以最低 6GB 显存生成一段一分钟 30fps 的视频。
camenduru/stable-diffusion-webui-colab
stable-diffusion-webui-colab 适合希望通过 Google Colab 使用 Stable Diffusion WebUI、又不准备搭建本地环境的图像与视频创作者。它的核心价值是提供已配置模型、扩展和相关资源的笔记本集合,但不适合作为离线或本地自托管方案。
WEIFENG2333/VideoCaptioner
videocaptioner 是一款桌面端视频字幕处理工具,将语音转写、字幕优化、翻译和视频合成整合在一套流水线中。它提供免费的 ASR 与翻译选项(无需配置即可使用),同时也支持接入大语言模型(LLM)提升处理效果。
AliaksandrSiarohin/first-order-model
first-order-model 提供源代码和预训练检查点,通过将驱动视频中的动作迁移到静止源图像来实现图像动画,支持在多种数据集上进行动作重定向。
duixcom/Duix-Avatar
duix-avatar 是一款本地离线运行的 AI 数字人克隆与视频合成软件,用户无需联网即可在本地生成数字人视频。
waooAI/waoowaoo
waoowaoo 是一款 AI 视频制作工具,能够将小说文本转化为分镜、角色、场景和完整的视频。该项目支持通过 Docker Compose 进行本地部署,并提供中文与英文界面。
HBAI-Ltd/Toonflow-app
toonflow-app 是一款开源桌面应用,提供从小说或剧本文本到角色生成分镜再到视频生成的短剧制作流水线。该项目依赖外部 AI 模型服务接口来执行核心的生成任务,通过多智能体协作和无限画布工作台组织创作流程。
zai-org/CogVideo
cogvideo 是一个开源的文本到视频与图像到视频扩散模型项目,提供推理优化与社区微调支持。该项目支持通过提示词或输入背景图像来生成视频内容。
palmier-io/palmier-pro
palmier-pro 是一款使用 Swift 从零构建的开源 macOS 视频编辑器,定位为 Premiere Pro 的开源替代方案。它允许用户与 AI 智能体在时间轴内协同生成和编辑视频。