AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
文档处理
浏览当前公开快照中“文档处理”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
infiniflow/ragflow
— ragflow 是一款面向企业的 RAG 引擎,核心特点是基于深度文档理解技术处理复杂格式的非结构化数据。它提供包含高质量文档分块和可溯源引用的 RAG 工作流,并支持配置外部 LLM 和嵌入模型。
opendatalab/MinerU
— mineru 是一款文档解析工具,可将 PDF、图片及 Office 文档转换为 Markdown 与 JSON 格式,服务于检索增强生成等下游处理流程。该项目支持复杂版面识别、公式与表格提取,并提供多种解析后端以适应不同硬件配置。
PaddlePaddle/PaddleOCR
— PaddleOCR 是一个文档解析库,旨在将非结构化的图像和 PDF 文档转换为结构化的 Markdown 或 JSON 数据,以支撑大语言模型应用。该项目提供了 0.9B 参数的轻量级视觉语言模型以及结构化解析能力。
docling-project/docling
— docling-project/docling 是一个文档处理库,能够解析包括 PDF 在内的多种文档格式,为生成式 AI 应用提供统一的文档表示格式和广泛的解析能力。
nashsu/llm_wiki
— llm_wiki 是一款桌面应用,利用 LLM 从用户的文档中增量构建并维护一个持久化、相互链接的知识 wiki。它与传统 RAG 的区别在于将知识编译为有组织的持久结构,而非每次从零开始检索和回答。
iOfficeAI/OfficeCLI
— officecli 以单一、无依赖的二进制 CLI 形式发布,使 AI 代理能够在不安装 Office 的情况下创建、读取、编辑 Word、Excel 和 PowerPoint 文件,并包含渲染功能用于文档视觉验证。
tesseract-ocr/tesseract
— tesseract-ocr/tesseract 是一款开源 OCR 引擎,提供基于神经网络(LSTM)的行识别和传统字符模式识别两种引擎,并支持 100 多种语言的文本识别。
Unstructured-IO/unstructured
— unstructured 是一个 Python 库,用于简化大语言模型(LLM)场景下非结构化数据的摄入与预处理,可将图片和文本文档转换为结构化输出。
paperless-ngx/paperless-ngx
— paperless-ngx 是一个由社区支持的文档管理系统,通过 OCR、组织和索引,将纸质或数字文档转化为可搜索的在线档案。它面向希望自行托管并集中管理文档的用户。
PDFMathTranslate/PDFMathTranslate
— pdfmathtranslate 是一款用于翻译科学 PDF 文档并保留原始版面布局的工具。它能够在翻译过程中保留公式、图表、目录和注释,并支持生成双语对照文档。
VectifyAI/PageIndex
— vectifyai/pageindex 适合评估以文档层级结构和大模型推理替代向量相似度检索的长文档 RAG 方案,尤其适用于需要页码、章节引用和上下文关联的场景。若主要输入是复杂 PDF,则不应只依赖其开源包的标准 PDF 解析能力。
google/langextract
— langextract 是一个用于从非结构化文本中提取结构化信息的 Python 库,提供精确的来源定位和长文档处理能力。它通过少量示例适配不同领域,并将每项抽取结果映射回源文本的精确位置以便溯源审查。
explosion/spaCy
— explosion/spacy 是面向 Python 生产场景的自然语言处理库,适合需要在统一体系内完成文本切分、标注、句法分析、实体识别、文本分类及模型训练与封装的团队。其选型优势在于处理速度、覆盖多语言的预训练管线,以及从训练到部署的工程化能力。
HKUDS/RAG-Anything
— rag-anything 是一个面向多模态文档处理的 RAG 框架,旨在解决传统纯文本 RAG 系统无法有效处理包含多样化多模态内容文档的问题。该框架整合了文档解析、专业内容分析与混合检索功能,支持从多种格式的文档中提取信息并回答多模态查询。
DrewThomasson/ebook2audiobook
— ebook2audiobook 将多种格式的电子书转换为带有章节和元数据的有声书,支持 1158 种语言和多种 TTS 引擎。该工具可选克隆自定义声音,并能以较低硬件门槛在本地或托管环境中运行。
JaidedAI/EasyOCR
— easyocr 是一个支持 80 多种语言和主要书写体系的即用型 OCR 库,接受多种图像输入形式并返回包含边界框、文本和置信度的结构化结果。
presenton/presenton
— presenton/presenton 是一个可自托管或以桌面应用运行的 AI 演示文稿生成器与 API,用户可自主选择模型、管理数据、编辑模板并导出可编辑文件。它通过提示词、上传文档或已有 PowerPoint 设计来生成演示文稿,并以可编辑 PPTX 或 PDF 格式输出。
AsyncFuncAI/deepwiki-open
— asyncfuncai/deepwiki-open 适合将 GitHub、GitLab 或 BitBucket 代码仓库转换为交互式 Wiki,并同时生成文档与可视化图表。若选型要求自托管、明确的数据边界或已知成本,应先补充核验,因为现有资料未说明这些条件。
StarTrail-org/PixelRAG
— PixelRAG 是一种基于视觉的检索方案,通过将文档渲染为截图并以图像切片的方式进行检索,解决了传统文本解析丢失表格、图表和排版等视觉结构信息的问题。用户可以通过托管 API 立即体验预构建的 828 万维基百科页面索引,或通过 pip 安装后在本地处理自定义文档。
allenai/olmocr
— allenai/olmocr 将 PDF、PNG 和 JPEG 文档转换为保留公式、表格和阅读顺序的干净 Markdown 文本,用于 LLM 数据集和训练,处理成本低于每百万页 200 美元。
microsoft/unilm
— microsoft/unilm 提供一组预训练基础模型、架构与工具,覆盖 NLP、视觉、语音及文档 AI 等多种任务。其中 LayoutLM 是面向文档 AI 的多模态(文本 + 版面/格式 + 图像)基础模型,可用于扫描文档、PDF 等场景。
×