文档处理 开源项目
浏览当前公开快照中经过筛选的 文档处理 AI 开源项目,并进入项目详情查看适用场景、部署条件、限制与核验证据。
当前展示 21 个可索引项目。
iOfficeAI/OfficeCLI
officecli 以单一、无依赖的二进制 CLI 形式发布,使 AI 代理能够在不安装 Office 的情况下创建、读取、编辑 Word、Excel 和 PowerPoint 文件,并包含渲染功能用于文档视觉验证。
infiniflow/ragflow
ragflow 是一款面向企业的 RAG 引擎,核心特点是基于深度文档理解技术处理复杂格式的非结构化数据。它提供包含高质量文档分块和可溯源引用的 RAG 工作流,并支持配置外部 LLM 和嵌入模型。
PaddlePaddle/PaddleOCR
PaddleOCR 是一个文档解析库,旨在将非结构化的图像和 PDF 文档转换为结构化的 Markdown 或 JSON 数据,以支撑大语言模型应用。该项目提供了 0.9B 参数的轻量级视觉语言模型以及结构化解析能力。
Unstructured-IO/unstructured
unstructured 是一个 Python 库,用于简化大语言模型(LLM)场景下非结构化数据的摄入与预处理,可将图片和文本文档转换为结构化输出。
opendatalab/MinerU
mineru 是一款文档解析工具,可将 PDF、图片及 Office 文档转换为 Markdown 与 JSON 格式,服务于检索增强生成等下游处理流程。该项目支持复杂版面识别、公式与表格提取,并提供多种解析后端以适应不同硬件配置。
tesseract-ocr/tesseract
tesseract-ocr/tesseract 是一款开源 OCR 引擎,提供基于神经网络(LSTM)的行识别和传统字符模式识别两种引擎,并支持 100 多种语言的文本识别。
docling-project/docling
docling-project/docling 简化多种文档格式的解析,并将其转化为统一的文档表示,为生成式 AI 应用准备数据。该项目提供 PDF 深度解析、多格式导出,以及与生成式 AI 生态系统的集成支持。
paperless-ngx/paperless-ngx
paperless-ngx 是一个由社区支持的文档管理系统,通过 OCR、组织和索引,将纸质或数字文档转化为可搜索的在线档案。它面向希望自行托管并集中管理文档的用户。
google/langextract
langextract 是一个用于从非结构化文本中提取结构化信息的 Python 库,提供精确的来源定位和长文档处理能力。它通过少量示例适配不同领域,并将每项抽取结果映射回源文本的精确位置以便溯源审查。
PDFMathTranslate/PDFMathTranslate
pdfmathtranslate 是一款用于翻译科学 PDF 文档并保留原始版面布局的工具。它能够在翻译过程中保留公式、图表、目录和注释,并支持生成双语对照文档。
VectifyAI/PageIndex
vectifyai/pageindex 适合评估以文档层级结构和大模型推理替代向量相似度检索的长文档 RAG 方案,尤其适用于需要页码、章节引用和上下文关联的场景。若主要输入是复杂 PDF,则不应只依赖其开源包的标准 PDF 解析能力。
explosion/spaCy
explosion/spacy 是面向 Python 生产场景的自然语言处理库,适合需要在统一体系内完成文本切分、标注、句法分析、实体识别、文本分类及模型训练与封装的团队。其选型优势在于处理速度、覆盖多语言的预训练管线,以及从训练到部署的工程化能力。
JaidedAI/EasyOCR
easyocr 是一个支持 80 多种语言和主要书写体系的即用型 OCR 库,接受多种图像输入形式并返回包含边界框、文本和置信度的结构化结果。
HKUDS/RAG-Anything
rag-anything 是一个面向多模态文档处理的 RAG 框架,旨在解决传统纯文本 RAG 系统无法有效处理包含多样化多模态内容文档的问题。该框架整合了文档解析、专业内容分析与混合检索功能,支持从多种格式的文档中提取信息并回答多模态查询。
microsoft/unilm
microsoft/unilm 提供一组预训练基础模型、架构与工具,覆盖 NLP、视觉、语音及文档 AI 等多种任务。其中 LayoutLM 是面向文档 AI 的多模态(文本 + 版面/格式 + 图像)基础模型,可用于扫描文档、PDF 等场景。
DrewThomasson/ebook2audiobook
ebook2audiobook 将多种格式的电子书转换为带有章节和元数据的有声书,支持 1158 种语言和多种 TTS 引擎。该工具可选克隆自定义声音,并能以较低硬件门槛在本地或托管环境中运行。
allenai/olmocr
allenai/olmocr 将 PDF、PNG 和 JPEG 文档转换为保留公式、表格和阅读顺序的干净 Markdown 文本,用于 LLM 数据集和训练,处理成本低于每百万页 200 美元。
pot-app/pot-desktop
pot-desktop 是一个跨平台桌面应用,聚合了多种外部和本地服务,提供划词翻译、输入翻译、截图 OCR、截图翻译及语音合成等功能。它通过可扩展的 .potext 插件系统实现功能增强,适合需要在 PC 端进行多源文本翻译和文字识别的用户。
AsyncFuncAI/deepwiki-open
asyncfuncai/deepwiki-open 适合将 GitHub、GitLab 或 BitBucket 代码仓库转换为交互式 Wiki,并同时生成文档与可视化图表。若选型要求自托管、明确的数据边界或已知成本,应先补充核验,因为现有资料未说明这些条件。
lukas-blecher/LaTeX-OCR
latex-ocr 是一个基于学习的系统,可将数学公式图像转换为 LaTeX 代码,并提供 CLI、GUI 和 Python 库调用等使用方式。
nashsu/llm_wiki
llm_wiki 是一款桌面应用,利用 LLM 从用户的文档中增量构建并维护一个持久化、相互链接的知识 wiki。它与传统 RAG 的区别在于将知识编译为有组织的持久结构,而非每次从零开始检索和回答。