AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
English
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
数据分析
浏览当前公开快照中“数据分析”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
bradautomates/claude-video
— claude-video 以自包含技能单元形式,让 AI 助手通过下载视频、提取帧和转录音频来获取视频内容。该技能支持在多个代理宿主中运行,依赖 ffmpeg 和 yt-dlp 处理视频,并可通过可选的 Groq 或 OpenAI API 进行音频转录。
qdrant/qdrant
— qdrant 是用 Rust 编写的向量相似度搜索引擎,支持稠密向量、稀疏向量、多向量搜索与 JSON 负载过滤,并提供分片与副本的横向扩展能力。内置量化可将 RAM 占用降低多达 97%,用户可在搜索速度与精度之间进行调节。
wonderwhy-er/DesktopCommanderMCP
— desktopcommandermcp 是一个 MCP 服务器,用于让 AI 助手在本地执行终端命令、管理进程、编辑文件和分析数据。它采用宿主客户端订阅而非 API token 费用的方式运行。
TauricResearch/TradingAgents
— tradingagents 是一个多智能体 LLM 框架,通过部署专门的分析、研究、交易和风险管理智能体来模拟真实交易公司的运作,以协助评估市场状况并告知交易决策。该项目专为研究目的设计,其输出并非保证收益的财务或投资建议。
microsoft/ML-For-Beginners
— microsoft/ml-for-beginners 是一套面向初学者的 12 周、26 课时经典机器学习项目制课程,使用 Scikit-learn 并配备课前课后测验与作业。课程围绕统一主题构建实践项目,同时避开深度学习内容。
OpenBB-finance/OpenBB
— openbb-finance/openbb 是一个面向金融数据的接入与分发基础设施层,采用"一次接入,处处消费"架构,将专有数据、授权数据和公开数据源统一暴露给 Python 环境、OpenBB Workspace、面向 AI 智能体的 MCP 服务器及 REST API 等多种下游消费端。
scikit-learn/scikit-learn
— scikit-learn 是基于 SciPy 构建的 Python 机器学习模块,提供机器学习算法、工具及结果可视化绘图功能。该项目始于 2007 年,是一个发展成熟的 Python 库。
virattt/ai-hedge-fund
— 这是一个概念验证(PoC)级别的 AI 对冲基金项目。它通过组合专业的投资者智能体和市场分析智能体来探索 AI 在交易决策中的应用,仅供教育和研究使用,不执行任何真实交易。
pathwaycom/pathway
— pathway 是一个用 Python 编写、由 Rust 引擎驱动数据处理框架,使用同一套代码同时处理批量和流式数据。它适用于构建可扩展的 ETL 管道、实时分析和 RAG 应用。
ZhuLinsen/daily_stock_analysis
— daily_stock_analysis 是一个基于大语言模型的多市场股票分析应用,聚合股票数据与新闻,生成面向决策的报告、决策驾驶舱和自动化通知。它还提供 Web 与桌面工作区,以及面向股票问题的多轮交互能力。
pathwaycom/llm-app
— llm-app 是一组可直接运行的 RAG 与 AI 企业搜索应用模板,部署后可与持续变化的实时数据源保持同步。模板将数据索引与检索功能包含在内部,据项目自述使用时无需另行搭建独立的向量数据库等基础设施。
microsoft/qlib
— Qlib 是一个面向量化投资研究的模块化框架,覆盖从数据处理到模型训练再到回测的完整流程。它通过 qrun 工具自动串联整个工作流,支持包括强化学习在内的多种机器学习范式。
PostHog/posthog
— PostHog 将产品分析、会话回放、错误追踪、功能开关和 A/B 实验整合到统一平台。其自主诊断模式能自动将产品异常信号转化为研究报告和可供审查合并的拉取请求,帮助团队从数据洞察推进到代码修复流程。
shiyu-coder/Kronos
— Kronos 是一个面向金融 K 线(蜡烛图)序列的预训练基础模型,采用分层分词器和自回归 Transformer 架构,旨在支持多种量化任务。该项目自述在超过 45 个全球交易所的数据上进行了预训练,并称自身为首个针对金融 K 线的开源基础模型。
OpenBMB/ChatDev
— chatdev 是一个零代码多智能体编排平台,用户通过可视化画布设计、编排和执行复杂智能体工作流。该平台使用户无需编程即可快速构建并运行自定义多智能体系统。
explosion/spaCy
— explosion/spacy 是面向 Python 生产场景的自然语言处理库,适合需要在统一体系内完成文本切分、标注、句法分析、实体识别、文本分类及模型训练与封装的团队。其选型优势在于处理速度、覆盖多语言的预训练管线,以及从训练到部署的工程化能力。
hsliuping/TradingAgents-CN
— hsliuping/tradingagents-cn 是一个中文本地化的多智能体 LLM 股票分析学习与研究平台,支持 A股、港股和美股研究,但不提供真实交易指令。
HKUDS/Vibe-Trading
— vibe-trading 是一个将自然语言提问接入市场数据加载、策略生成、回测引擎与研究报告的量化研究工作台。它覆盖 A/HK/US 股票、加密货币、期货和外汇市场,提供自改进代理和多代理团队来辅助投资与风险分析。
donnemartin/data-science-ipython-notebooks
— donnemartin/data-science-ipython-notebooks 是一套结构化的可执行 IPython Notebook 教学合集,覆盖深度学习、数据科学、大数据和 AWS 云服务。适合希望在同一仓库内通过交互式实践掌握 TensorFlow、scikit-learn、Spark 与 pandas 的开发者。
dmlc/xgboost
— XGBoost 是一个高效、灵活且可移植的分布式梯度提升库,旨在解决单机和分布式环境下的数据科学问题。它支持在数十亿级别的数据规模上进行并行的梯度提升树模型训练。
OtterMind/Chat2DB
— chat2db 是一款跨平台、本地运行的数据库客户端,提供包含 SQL 编辑、执行和管理在内的完整工作台,并支持接入用户自备的 AI 模型来辅助生成、解释和优化 SQL。
google-research/timesfm
— TimesFM 是一个预训练的 decoder-only 时间序列预测基础模型,旨在为时间序列预测提供稳健的解决方案。
apify/crawlee
— apify/crawlee 是一个开源的网页抓取与浏览器自动化库,提供统一接口来执行 HTTP 和无头浏览器爬取。该库默认包含浏览器指纹生成与代理轮换等功能,用于在现代反爬检测下构建可靠的爬虫。
sinaptik-ai/pandas-ai
— pandas-ai 是一个 Python 库,支持用户以自然语言向 DataFrame、CSV、SQL 或 parquet 数据提问,并借助 LLM 与 RAG 生成可视化结果。它适合将自然语言数据交互接入 Python 工作流的场景。
anthropics/knowledge-work-plugins
— knowledge-work-plugins 提供 11 套即用型插件集合,将角色专属技能、斜杠命令和 MCP 服务器连接器配置打包在一起,使 Claude 成为特定岗位的专家助手。全部基于 Markdown 和 JSON 文件,无需编写代码即可按组织需求定制。
airbytehq/airbyte
— airbytehq/airbyte 是一个开源数据移动平台,用于构建 ELT 数据管道,提供 600 余个连接器。它支持自托管部署,也可通过云端服务使用。
AI4Finance-Foundation/FinGPT
— fingpt 面向金融文本处理与金融大语言模型定制,提供金融预测、多任务金融模型、低秩适配微调和检索增强框架。它适合具备 Python、模型运行环境和金融数据处理需求的研究与工程团队,不适合作为真实资金交易或投资建议工具。
eosphoros-ai/DB-GPT
— db-gpt 是一个开源的智能数据助手,能够连接多种数据源,通过大语言模型自主完成数据分析、Text-to-SQL 和代码执行,并生成图表与报告。该项目支持私有化部署和本地模型推理,适合需要对内部数据进行自然语言分析的场景。
lightgbm-org/LightGBM
— lightgbm 是一个基于树学习算法的梯度提升框架,针对大规模数据训练场景提供较快的训练速度和较低的内存占用。
bbfamily/abu
— abu 项目提供面向股票、期权、期货和比特币的量化交易架构,利用机器学习优化交易策略,并通过非编程界面降低普通用户的使用门槛。
argoproj/argo-workflows
— argo-workflows 是一个开源的容器原生工作流引擎,运行于 Kubernetes 之上,用于编排并行任务并管理任务间的依赖关系。用户可以将机器学习或数据处理等计算密集型作业建模为多步骤工作流或 DAG,每个步骤以容器方式执行。
Canner/WrenAI
— wrenai 是一个开源 GenBI 引擎,通过版本控制的开放上下文层为 AI 代理提供受治理的业务语义,使其能够跨多种数据源生成、部署和治理可信的商业智能内容(SQL 和仪表盘)。
googleapis/mcp-toolbox
— mcp-toolbox 是一个兼具 MCP 服务器与自定义工具开发框架双重定位的数据库工具箱,为 AI 智能体与数据源之间的连接提供连接池、身份验证和可观测性支持。
apache/doris
— apache/doris 是一款开源 MPP 数据库,提供快速 SQL 分析、湖仓查询加速以及跨结构化数据、文本和向量数据的混合搜索能力,面向高并发实时工作负载。
xbtlin/ai-berkshire
— ai-berkshire 是一套投资研究技能集合,通过四位价值投资大师方法论的多智能体对抗分析,生成带明确结论的投资研究报告。它直接解决向 AI 提问获取投资分析时结果缺乏决策纪律、结构化与可操作性不足的问题。
llmware-ai/llmware
— llmware-ai/llmware 是一个用于在本地、私有和安全环境中构建 LLM 应用的框架,提供包含 300+ 模型的目录和 RAG 流水线组件。
ConardLi/easy-dataset
— easy-dataset 是一款专注于将多格式领域文档转化为高质量结构化数据集的应用,覆盖微调数据构建、RAG 数据准备与评测集生成的全流程。它内置多种文本分割算法和人类盲测评测系统,适合需要从私有文档产出可训练数据的 AI 工程团队。
davisking/dlib
— dlib 是一个现代 C++ 工具包,提供机器学习算法和工具,用于创建解决现实问题的复杂软件。它支持通过 C++ 源码或 Python 脚本使用,适用于构建机器学习和数据分析应用。
microsoft/RD-Agent
— microsoft/rd-agent 是一个自动化数据驱动研发流程的开源项目,让 AI 自主从真实材料中提取模型与公式并迭代提出新方案。它覆盖量化交易、数据科学竞赛、论文研读和模型微调等多个研发场景。
DataTalksClub/machine-learning-zoomcamp
— machine-learning-zoomcamp 是一个免费的开源机器学习工程课程,周期为 4 个月,内容覆盖从使用 Python 构建模型到生产部署的完整流程。(依据:value_proposition)
×