文档智能解析的三条技术路线
文档解析经历了从规则模板、PDFParse 工具解析到深度学习版面分析的演进。当前智能文档处理主要承担大模型语料加工与 RAG 系统中的数据清洗工作,主流方案分为三条路线。
- OCR-PIPELINE:将 PDF 转为图片后做版式分析与区块切割,对段落、标题、公式、表格分别处理,再通过阅读顺序排序恢复为 Markdown。优点是能拿到 bounding box 与版式标签、模块灵活可单独优化、支持 CPU 离线部署与扫描件;缺点是依赖场景数据导致泛化性差、精度在版式分析与表格解析环节仍有提升空间、CPU 环境下模块多速度慢。
- OCR-Free:以 olmOCR、Mistral OCR 等多模态大模型端到端解析出 Markdown。缺点相当直接:不支持区域分块与 bbox 输出、无法 CPU 离线部署、速度慢且 GPU 资源消耗大、长文本显存占用高、存在多字少字等幻觉问题,复杂文档也无法截图存储。
- PDF-Parse:规则驱动工具直接提取可编辑 PDF 的文字,速度快、在可编辑场景下比 OCR 更准确,但不支持扫描版文档,对图片与表格处理效果欠佳。
版式分析与关键元素解析
版式分析是整条链路的枢纽,本质是目标检测任务,核心在于标签定义——正文、标题、图片、图片标题、表格等。上海人工智能实验室的 DocLayout-YOLO 在多场景数据标注上做了大量工作,泛化性提升明显。实践中也有基于 YOLOv8 的轻量化模型,单个模型仅 6.23MB,针对中文论文、英文论文、中文研报、教材四个场景细粒度标注后在垂直场景中速度优势突出。
表格解析分为多线表、缺线表、无线表三类,传统 CV 方法检测 cells 与 table structure 后与 OCR 文本做 IOU 匹配合并,重建为 Excel 或 HTML。团队也训练了 7B 左右的端到端多模态表格解析模型,但幻觉问题依然严重。目前百度开源的 SLANet-plus 在 TEDS 指标上表现最佳,但对有线表格解析更好。公式解析方面,团队基于 VisionEncoderDecoder 架构、预训练加微调并采用早停机制防止过拟合,该工作获 ICPR 2024 多行数学表达式识别任务冠军;改进版 HDNet 按层级划分复杂公式起到数据增强效果,在 Fair-CR 指标上达 0.963,参数量仅约 300M。
阅读顺序上接版式分析、下接 Markdown 转换,早期基于规则的 XY-cut 效果一般,语义方法 LayoutReader 依赖标注数据,最新的 DLAFormer 是端到端模型,把阅读顺序与版式分析建模为关系预测任务。此外还有 Doc2ToC 构建章节 parent-of 层级关系、Figure2meta 抽取图表元信息,以及在 DocGraph 中把图表与其标题、来源、引用段落、所属章节建立层级关联——这一步尤其关键:RAG 常召回"如表所示"这类 chunk 而图已丢失,实体链接式的图—文绑定能补上这个洞。
多模态图索引与检索生成流程
索引构建流程为:多模态数据源经预处理模块分流,文本模块做分词与实体识别,图像处理模块做特征抽取或目标检测,视频逐帧处理,音频做语音转文本;随后跨模态关联构建图结构——节点为实体、图像、视频片段,边关系涵盖时空、语义与跨模态关系,存储到 Neo4j、TigerGraph 等图数据库;嵌入部分图像可用 ViT、视频用 3D-CNN,再做图文、文视、文音的跨模态对齐,最后用 FAISS、Milvus 等向量库做联合索引。
检索生成流程为:用户纯文本或图文混合 query 先经解析形成多模态检索,检索策略包括图模式匹配的子图检索、向量相似度检索、跨模态关联检索,结果融合与相关性排序后再送入大模型生成,最后做标准化处理与引文来源标注。相比传统 RAG 把表格图片统统 summary 成文本、只保留单一文本模态,多模态嵌入为文本、表格、图片分别建立嵌入,在搜索精度、上下文理解、对象识别、相似性搜索、图推理、可解释性与领域知识定制上均有明显增益。
知识图谱补齐 chunk 之间的关联
传统 RAG 的 chunk 彼此孤立、缺乏关联,跨文档问答表现不佳,且容易召回噪声片段。知识图谱的价值正在于此:引入专家知识后,可通过实体层级特征增强相关性、增强 chunk 之间的关联;若已有 KG 数据,可直接将其作为召回信息源补充上下文;更进一步,可把各类知识组织成 KG,提供图视角上的 embedding 以补充召回特征,从而解决细粒度检索问题。
文档多模态 RAG 进展与实践建议
当前涌现出大量文档多模态 RAG 工作,输入文档截图经大模型端到端问答,省去 OCR pipeline 链路。解析式文档多模态 RAG 的核心思想是先将文档切分为页面,再用版式识别对各模态元素分割、解析、提取,然后嵌入检索;DocVQA 式整页检索则有 ColPali、VisRAG 等代表工作。
总结环节给出了两点务实判断:其一,多模态大模型为文档处理带来新契机,可用于端到端处理或对细分块处理,但资源消耗极大——MMOCR 多模态大模型在简单表格上能端到端输出 Markdown,却无法截图定位,因此资源受限场景建议采用 pipeline 模式;其二,知识图谱要积极拥抱变化,过去包袱太重需要轻投入,但核心价值不能丢,其内涵要从结构、粒度、形式等多方面演进。