ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

PaddleOCR PP-Structure 系列模型库全解析:版面分析、表格识别与关键信息抽取模型选型指南

PaddleOCR PP-Structure 系列模型库全解析:版面分析、表格识别与关键信息抽取模型选型指南 PaddleOCR PP-Structure 系列模型库全解析版面分析、表格识别与关键信息抽取模型选型指南【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR本文围绕 docs/version2.x/ppstructure/ppstructure_model.md 展开系统梳理 PP-Structure 版面分析、OCR、表格识别与 KIE 关键信息抽取四类模型的适用场景、推理模型大小、精度与下载方式并结合仓库中的字典文件与ppstructure目录源码说明模型与配置的对应关系帮助你在实际文档理解任务中快速完成模型选型与搭配。PP-Structure 是 PaddleOCR 团队自研的智能文档分析系统覆盖版面分析、表格识别、关键信息抽取KIE等文档理解任务详见 overview.md。其中模型列表页是选型的第一入口它按“版面分析 → OCR 与表格识别 → KIE”三层结构给出官方可用模型及其配套字典文件。读完本文你将掌握每类模型的类别划分能力、中英文适用场景、精度与体积权衡以及如何用det_model_dir、rec_model_dir、layout_model_dir等字段替换为自训模型。一、版面分析模型从整页文档到语义区域版面分析是 PP-Structure 流水线的第一步负责把文档图像划分为文字、标题、表格、图片等不同语义区域供后续 OCR、表格识别等模块分别处理。模型列表中共收录 6 个版面分析模型分为 PicoDet 轻量系列与 PP-YOLOv2 高精度系列两条路线。1.1 轻量级PicoDet LCNet_x1_0 FGD 蒸馏系列模型名称训练数据可划分区域推理模型大小配套字典picodet_lcnet_x1_0_fgd_layoutPubLayNet英文文字、标题、表格、图片、列表5 类9.7Mlayout_publaynet_dict.txtpicodet_lcnet_x1_0_fgd_layout_cdlaCDLA中文表格、图片、图片标题、表格标题、页眉、页脚、脚本、引用、公式10 类9.7Mlayout_cdla_dict.txtpicodet_lcnet_x1_0_fgd_layout_table表格数据集中英文文档表格区域检测9.7Mlayout_table_dict.txt三个轻量模型均为 9.7M 推理模型采用 LCNet_x1_0 骨干网络与 FGDFeature-map-level Gathered Distillation特征图级聚合蒸馏技术训练兼顾速度与精度。三者的差异完全由训练数据与字典决定英文通用版面PubLayNet 是公开英文版面数据集对应字典layout_publaynet_dict.txt内容为text / title / list / table / figure五类标签中文通用版面CDLA 中文数据集对应字典layout_cdla_dict.txt内容为text / title / figure / figure_caption / table / table_caption / header / footer / reference / equation十类标签覆盖了页眉页脚、公式等中文论文排版常见区域纯表格检测layout_table_dict.txt只包含table一个类别专门用于定位表格区域适合已明确目标为表格抽取的场景。字典文件在仓库中的实际位置为ppocr/utils/dict/layout_dict/目录下上述三个文件均已确认存在与文档中的dict path列一一对应。1.2 高精度PP-YOLOv2 R50vd DCN 系列模型名称训练数据推理模型大小ppyolov2_r50vd_dcn_365e_publaynetPubLayNet英文通用版面221.0Mppyolov2_r50vd_dcn_365e_tableBank_wordTableBank Word英文表格221.0Mppyolov2_r50vd_dcn_365e_tableBank_latexTableBank Latex英文表格221.0MPP-YOLOv2 系列采用 R50vd 骨干与 DCN 可变形卷积推理模型大小约 221M适合对版面区域检测精度要求高、对模型体积不敏感的服务端场景。其中 TableBank Word 与 TableBank Latex 两个模型分别针对 Word 渲染表格与 LaTeX 排版表格训练均是表格区域检测专用模型。1.3 从源码看版面分析流程仓库中版面分析的实际执行逻辑位于 ppstructure/layout/predict_layout.py 的LayoutPredictor类。从源码结构看其前处理将输入图像 Resize 到[800, 608]按 ImageNet 均值方差归一化后处理构建PicoDetPostProcess时传入三个关键参数layout_dict_path即上文提到的字典文件路径用于将模型输出的类别索引映射为区域名称score_threshold检测框置信度阈值默认 0.5nms_threshold非极大值抑制阈值默认 0.5。因此当你替换版面分析模型时必须同步更换对应的字典文件否则类别编号与区域名称将错位这正是模型列表中为每个版面分析模型单独列出dict path列的原因。二、OCR 与表格识别模型结构化读取的前置与核心版面分析划分出区域后文本区域需要 OCR 识别表格区域需要表格结构识别。模型列表将这部分分为 OCR 与表格识别两类。2.1 OCR 模型表格场景专用 OCR 模型在 PubTabNet 数据集上训练模型名称任务推理模型大小en_ppocr_mobile_v2.0_table_det英文表格场景文字检测4.7Men_ppocr_mobile_v2.0_table_rec英文表格场景文字识别6.9M文档同时给出重要提示如需使用其他 OCR 模型可以在 PP-OCR model_list 下载模型或使用自己训练好的模型配置到det_model_dir、rec_model_dir两个字段即可。这意味着 PP-Structure 的 OCR 环节完全复用 PP-OCR 的模型体系中英文、多语种检测识别模型如 PP-OCRv4_mobile_det/rec、PP-OCRv3_mobile_det/rec 等见 PP-OCR 模型列表均可直接接入。2.2 表格识别模型模型名称算法与训练数据推理模型大小en_ppocr_mobile_v2.0_table_structureTableRec-RAREPubTabNet英文6.8Men_ppstructure_mobile_v2.0_SLANetSLANetPubTabNet英文9.2Mch_ppstructure_mobile_v2.0_SLANetSLANet中文9.3M其中 SLANetStructure Layout Analysis Network是 PP-Structure 系列主推的表格结构识别模型中英文各有一个版本推理模型约 9.2~9.3M。表格识别输出的结果是一个包含表格 HTML 字符串的 dict可进一步转换为 Excel 文件save_structure_res会把每个表格另存为 xlsx详见 quick_start.md 的返回结果说明。三、关键信息抽取KIE模型SER 与 RE 双任务KIE 任务包含两个子任务SERSemantic Entity Recognition语义实体识别从文档中抽取语义实体如发票上的金额、抬头等RERelation Extraction关系抽取建立实体之间的对应关系如问题-答案配对。3.1 XFUND_zh 数据集上的精度与速度对比模型列表给出在 XFUND_zh 中文数据集上的 hmean 精度与 V100 GPU 推理耗时仅 inference 模型推理耗时不含前后处理模型名称任务推理模型大小精度(hmean)预测耗时(ms)ser_VI-LayoutXLM_xfund_zhSER1.1G93.19%15.49re_VI-LayoutXLM_xfund_zhRE1.1G83.92%15.49ser_LayoutXLM_xfund_zhSER1.4G90.38%19.49re_LayoutXLM_xfund_zhRE1.4G74.83%19.49ser_LayoutLMv2_xfund_zhSER778.0M85.44%31.46re_LayoutLMv2_xfund_zhRE765.0M67.77%31.46ser_LayoutLM_xfund_zhSER430.0M77.31%-从表中可以清晰看出模型代际演进VI-LayoutXLM在 XFUND_zh 上 SER 精度最高93.19%且耗时最短15.49ms是当前推荐首选LayoutXLM次之SER 90.38%体积更大1.4GLayoutLMv2与LayoutLM为较早的跨模态预训练模型精度依次递减其中 LayoutLM 推理耗时未给出表中为-。注上述预测耗时仅包含 inference 模型推理耗时未统计预处理与后处理耗时测试环境为V100 GPU CUDA 10.2 CUDNN 8.1.1 TRT 7.2.3.4。3.2 wildreceipt 数据集上的 SDMGR模型名称模型简介模型大小精度SDMGR关键信息提取模型Spatial Dual-Modality Graph Reasoning78.0M86.70%SDMGR 在 wildreceipt 数据集上达到 86.70% 精度体积仅 78M适合票据类关键信息抽取场景。仓库中 KIE 相关训练配置位于 configs/kie 目录按layoutlm_series、vi_layoutxlm、sdmgr三个子目录组织与模型列表中的模型家族一一对应可据此查看对应训练配置。四、模型选型与搭配建议PP-Structure 部分任务需要同时使用结构化分析模型与 OCR 模型如表格识别需要表格结构模型解析结构同时需要 OCR 模型识别单元格内文字。结合模型列表与 overview.md 的说明给出以下搭配思路通用中英文文档理解picodet_lcnet_x1_0_fgd_layout英文/picodet_lcnet_x1_0_fgd_layout_cdla中文做版面分析 PP-OCR 检测识别模型做文字识别 SLANet中/英文做表格结构识别全流程模型体积可控适合服务端常规部署仅关注表格可用picodet_lcnet_x1_0_fgd_layout_table或 TableBank 系列先定位表格区域再送入表格识别模型也可直接关闭版面分析layoutfalse跳过检测单独跑表格识别高精度版面分析选用 PP-YOLOv2 R50vd DCN 系列221M代价是更高的显存占用与推理耗时票据/证照关键信息抽取SER 用ser_VI-LayoutXLM_xfund_zh93.19% hmeanRE 用re_VI-LayoutXLM_xfund_zh或轻量场景选用 SDMGR。五、模型替换与自训模型接入文档明确说明版面分析模型可通过layout_model_dir字段指定配套字典通过layout_dict_path指定默认layout_publaynet_dict.txtOCR 模型通过det_model_dir、rec_model_dir替换表格结构模型通过table_model_dir、table_char_dict_path配置KIE 的 SER 模型通过ser_model_dir、ser_dict_path配置。相关参数及其默认值在 quick_start.md 的参数说明表中完整列出主要包括参数说明默认值layout_model_dir版面分析模型 inference 模型地址Nonelayout_dict_path版面分析模型字典../ppocr/utils/dict/layout_publaynet_dict.txtlayout_score_threshold版面分析检测框置信度阈值0.5layout_nms_threshold版面分析 NMS 阈值0.5table_model_dir表格结构模型 inference 模型地址Nonetable_char_dict_path表格结构模型字典../ppocr/utils/dict/table_structure_dict.txttable_max_len表格结构模型预测时图像长边 resize 尺度488ser_model_dirSER 模型 inference 模型地址Noneser_dict_pathSER 模型字典../train_data/XFUND/class_list_xfun.txtkie_algorithmKIE 模型算法LayoutXLM需要注意替换模型时字典必须与模型训练时使用的类别顺序一致。以版面分析为例模型输出的类别索引正是按layout_publaynet_dict.txt、layout_cdla_dict.txt等文件中的行序编号的字典错配将直接导致区域类别标注错误。六、小结PP-Structure 系列模型库围绕版面分析 → OCR/表格识别 → 关键信息抽取的文档理解链路提供了轻量PicoDet 9.7M / SLANet 9.2M与高精度PP-YOLOv2 221M / VI-LayoutXLM 1.1G两条完整选型路线且所有模型均可通过 whl 包参数自由组合替换。结合 ppstructure_model.md 的模型清单、models_list.md 的完整列表、overview.md 的系统流程与 quick_start.md 的实战教程即可针对中英文文档解析、表格抽取、票据信息抽取等场景快速搭建可落地的结构化文档理解方案。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进