You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

求推荐适用于书籍目录信息提取的预训练模型(需结合文档布局分析)

书籍目录图片结构化提取的预训练模型方案

可用预训练模型

  • LayoutLM系列(LayoutLMv2/LayoutLMv3):微软推出的多模态文档理解预训练模型,融合文本、布局位置与图像特征,能处理OCR输出的文本块及对应坐标信息,非常适配目录的层级结构识别、章节名与页码关联任务。可基于该模型微调,输入目录图片的OCR结果(含文本块位置),训练后实现章节层级、名称、页码的结构化提取。
  • DocLayNet衍生模型:依托DocLayNet大规模文档布局数据集训练的布局分析模型,可先识别目录中的主章节、子章节、页码等不同区块,再结合OCR结果完成内容提取与层级关联。
  • Table Transformer:虽最初针对表格理解,但可适配目录这类“层级化键值对”结构,能有效识别章节名与页码的对应关系,以及章节的嵌套层级。

相关论文中文译名

  1. 《从OCR识别的书籍中提取目录结构》(原英文标题:TOC structure extraction from OCR-ed books)
  2. 《论目录的识别与解析》(原英文标题:On the Reading of Tables of Contents)

实操步骤参考

  1. 预处理:用Tesseract等OCR工具提取目录图片的文本,同时保留每个文本块的坐标信息(x、y、宽度、高度)。
  2. 布局分析:用上述布局相关预训练模型区分目录中的不同层级条目、页码区块。
  3. 结构化提取:基于多模态预训练模型完成章节层级关联、名称与页码匹配,最终输出符合要求的结构化字典。

内容的提问来源于stack exchange,提问作者carlo97

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.03 15:01:02