数据处理 开源项目
浏览当前公开快照中经过筛选的 数据处理 AI 开源项目,并进入项目详情查看适用场景、部署条件、限制与核验证据。
当前展示 40 个可索引项目。
koala73/worldmonitor
worldmonitor 适合需要在同一界面查看全球新闻、地缘政治、金融与基础设施信号,并结合地图和人工智能简报开展态势研判的团队。若需求只是抓取网页、检索内部资料或连接数据库,应优先评估更聚焦的工具。
HKUDS/Vibe-Trading
vibe-trading 是一个将自然语言提问接入市场数据加载、策略生成、回测引擎与研究报告的量化研究工作台。它覆盖 A/HK/US 股票、加密货币、期货和外汇市场,提供自改进代理和多代理团队来辅助投资与风险分析。
tensorflow/tensorflow
tensorflow/tensorflow 是面向机器学习研究与应用开发的端到端开源框架,覆盖模型构建、训练、张量运算以及多平台运行。它更适合需要代码级控制、稳定 Python 或 C++ 接口和多种部署形态的团队,而非追求零代码体验的用户。
f/prompts.chat
f/prompts.chat 适合需要集中发现、复用、分发或私有化管理提示词的个人与团队;它的优势是提示词库、网页浏览、多种数据格式、自托管和工具集成形成了完整链路,但它本身不是模型推理或提示词效果评测平台。
firecrawl/firecrawl
firecrawl 是一款面向 AI 系统的 Web 数据搜索与抓取 API,可将网页内容转换为 Markdown、结构化 JSON 或截图。它接管了代理轮换、速率限制和 JS 渲染等底层细节,为 LLM 应用提供可用的数据源。
Snailclimb/JavaGuide
JavaGuide 是一份系统化的 Java 后端面试知识库,涵盖从计算机基础到分布式系统、系统设计及 AI 应用开发等多个主题。它以结构化文档和面试题库为核心,帮助开发者备战技术面试。
run-llama/llama_index
run-llama/llama_index 是一个面向 LLM 应用的数据框架,用于接入既有数据、组织数据,并在数据之上提供检索与查询接口。它适合需要用私有数据增强 LLM 应用或构建智能体应用的代码型团队。
unclecode/crawl4ai
crawl4ai 将网页内容转化为经过清洗的 Markdown 和结构化数据,适用于 RAG 和数据管道。该项目无需强制使用 API 密钥,提供包括 Python 库和 Docker 在内的多种部署方式,并具备浏览器控制与反爬虫规避能力。
supabase/supabase
supabase 是一个基于开源工具构建的后端即服务平台,以独立 Postgres 数据库为核心,为 Web、移动端及 AI 应用提供类 Firebase 的开发体验。它支持自托管,也可使用其托管的云服务。
TauricResearch/TradingAgents
tradingagents 是一个多智能体 LLM 框架,通过部署专门的分析、研究、交易和风险管理智能体来模拟真实交易公司的运作,以协助评估市场状况并告知交易决策。该项目专为研究目的设计,其输出并非保证收益的财务或投资建议。
microsoft/ML-For-Beginners
microsoft/ml-for-beginners 是一套面向初学者的 12 周、26 课时经典机器学习项目制课程,使用 Scikit-learn 并配备课前课后测验与作业。课程围绕统一主题构建实践项目,同时避开深度学习内容。
Unstructured-IO/unstructured
unstructured 是一个 Python 库,用于简化大语言模型(LLM)场景下非结构化数据的摄入与预处理,可将图片和文本文档转换为结构化输出。
krahets/hello-algo
hello-algo 是一本开源的数据结构与算法入门教程,面向初学者提供动画图解和可在 12 种以上编程语言中运行的源代码示例。
opendatalab/MinerU
mineru 是一款文档解析工具,可将 PDF、图片及 Office 文档转换为 Markdown 与 JSON 格式,服务于检索增强生成等下游处理流程。该项目支持复杂版面识别、公式与表格提取,并提供多种解析后端以适应不同硬件配置。
josephmisiti/awesome-machine-learning
awesome-machine-learning 是一份按编程语言分类整理的机器学习框架、库和软件的精选目录列表。该仓库本身只提供链接,不包含可运行的代码。
hiyouga/LlamaFactory
llamafactory 为 100 多种大语言模型和视觉语言模型提供统一微调框架,支持通过零代码 CLI 和 Web UI 完成训练,涵盖从持续预训练到 DPO/PPO 等多种算法与量化调优方案。
D4Vinci/Scrapling
scrapling 是一个自适应网页抓取框架,提供元素重定位、反机器人绕过和并发爬取能力。当目标网站结构发生变更时,框架能自动重新定位目标元素,降低数据采集流程的维护频率。
OpenBB-finance/OpenBB
openbb-finance/openbb 是一个面向金融数据的接入与分发基础设施层,采用"一次接入,处处消费"架构,将专有数据、授权数据和公开数据源统一暴露给 Python 环境、OpenBB Workspace、面向 AI 智能体的 MCP 服务器及 REST API 等多种下游消费端。
scikit-learn/scikit-learn
scikit-learn 是基于 SciPy 构建的 Python 机器学习模块,提供机器学习算法、工具及结果可视化绘图功能。该项目始于 2007 年,是一个发展成熟的 Python 库。
pathwaycom/pathway
pathway 是一个用 Python 编写、由 Rust 引擎驱动数据处理框架,使用同一套代码同时处理批量和流式数据。它适用于构建可扩展的 ETL 管道、实时分析和 RAG 应用。
sansan0/TrendRadar
sansan0/trendradar 是一个轻量级、可快速部署的舆情监控工具,通过聚合多平台热点与 RSS 订阅源,结合关键词与 AI 智能过滤,实现多渠道新闻追踪与推送。项目依赖外部 API 获取数据并支持通过自然语言描述筛选资讯。
ZhuLinsen/daily_stock_analysis
daily_stock_analysis 是一个基于大语言模型的多市场股票分析应用,聚合股票数据与新闻,生成面向决策的报告、决策驾驶舱和自动化通知。它还提供 Web 与桌面工作区,以及面向股票问题的多轮交互能力。
Avik-Jain/100-Days-Of-ML-Code
100-days-of-ml-code 是一个为期 100 天的机器学习学习路径,每日提供 Python 代码实现与解释算法概念的可视化信息图。该项目面向学习需求,配套了算法的数据集与数学基础资料。
microsoft/qlib
Qlib 是一个面向量化投资研究的模块化框架,覆盖从数据处理到模型训练再到回测的完整流程。它通过 qrun 工具自动串联整个工作流,支持包括强化学习在内的多种机器学习范式。
apache/airflow
apache/airflow 是一个用于以代码方式编写、调度和监控工作流与数据管道的平台。它以 DAG 形式定义工作流,配套提供可视化、监控和问题排查的 Web 界面。
siyuan-note/siyuan
siyuan 是一款隐私优先、本地优先的个人知识管理系统,支持 Markdown 所见即所得编辑与细粒度块级引用。多数功能可免费用于商业用途。
aymericdamien/TensorFlow-Examples
tensorflow-examples 是一套面向初学者的 TensorFlow v1 与 v2 示例和教程集合,覆盖基础模型、神经网络、数据管理与硬件加速等主题。该项目通过提供清晰、简洁的源代码和 Jupyter Notebook,帮助学习者快速了解并实践 TensorFlow 的各项 API。
ray-project/ray
ray 是一个统一的 Python 与 AI 应用分布式框架,旨在将计算密集型机器学习负载从单机开发环境扩展到集群。它提供无状态任务、有状态 Actor 和不可变对象的分布式抽象。
deepspeedai/DeepSpeed
deepspeed 面向需要扩展大模型训练与推理的 PyTorch 开发者,通过 ZeRO、ZeRO-Infinity、3D 并行和 Ulysses 序列并行等系统优化降低分布式计算的工程复杂度。它适合具备代码、编译工具链和环境排障能力的团队,不是面向非技术用户的开箱即用应用。
pingcap/tidb
pingcap/tidb 是面向事务、分析与向量检索混合需求的分布式 SQL 数据库,提供横向扩展、强一致性、MySQL 兼容性和 HTAP 能力。若团队希望减少多类数据基础设施的分散建设,同时保留自托管与托管服务两种选择,可将其纳入评估。
HKUDS/LightRAG
lightrag 是一个基于图结构的 RAG 框架,通过双层检索设计应对大规模知识图谱索引和检索时的计算开销与响应延迟问题。该框架支持在不重建全局索引的情况下进行增量数据更新,并提供局部、全局、混合等多种查询模式。
PostHog/posthog
PostHog 将产品分析、会话回放、错误追踪、功能开关和 A/B 实验整合到统一平台。其自主诊断模式能自动将产品异常信号转化为研究报告和可供审查合并的拉取请求,帮助团队从数据洞察推进到代码修复流程。
ashishpatel26/500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code
500-ai-machine-learning-deep-learning-computer-vision-nlp-projects-with-code 是一个持续更新的精选目录,提供超过 500 个涵盖人工智能、机器学习、深度学习、计算机视觉和 NLP 领域的外部项目、数据集与教程链接。它通过分类索引帮助用户快速发现带有源代码的学习资源,本身不提供可直接导入的应用程序或代码库。
microsoft/graphrag
microsoft/graphrag 面向需要从非结构化私有文本中提取结构化数据,并借助知识图谱记忆增强大语言模型输出与推理的开发者和数据团队。选型时应重点评估上手难度、索引成本、提示词调优投入,以及项目代码不属于微软官方支持产品这一边界。
shiyu-coder/Kronos
Kronos 是一个面向金融 K 线(蜡烛图)序列的预训练基础模型,采用分层分词器和自回归 Transformer 架构,旨在支持多种量化任务。该项目自述在超过 45 个全球交易所的数据上进行了预训练,并称自身为首个针对金融 K 线的开源基础模型。
explosion/spaCy
explosion/spacy 是面向 Python 生产场景的自然语言处理库,适合需要在统一体系内完成文本切分、标注、句法分析、实体识别、文本分类及模型训练与封装的团队。其选型优势在于处理速度、覆盖多语言的预训练管线,以及从训练到部署的工程化能力。
eriklindernoren/ML-From-Scratch
以纯 NumPy 从零实现主流机器学习与深度学习算法,剥离高层框架黑盒,让学习者直接阅读和运行源码理解原理。核心价值在于透明度而非生产性能,适合以教育为目的的算法拆解和教学演示。
SigNoz/signoz
SigNoz 是一个开源可观测性平台,基于 OpenTelemetry 标准将日志、指标、链路追踪、告警和仪表盘整合在一个平台中,并提供可预测的定价方式。
AMAI-GmbH/AI-Expert-Roadmap
ai-expert-roadmap 是一份社区共建的 AI、机器学习与数据科学学习路线图,以图表展示相关学习路径与技术。学习者可通过交互式网站点击列表中的知识点获取延伸链接,无需安装软件。
hsliuping/TradingAgents-CN
hsliuping/tradingagents-cn 是一个中文本地化的多智能体 LLM 股票分析学习与研究平台,支持 A股、港股和美股研究,但不提供真实交易指令。