能否用NLP合并PDF提取的拆分式Python列表文本?
问题背景
从图片PDF中提取得到的Python嵌套列表存在文本错误拆分问题,例如:
原始拆分结果:
['Mr. Aram GABRIELYAN', 'Head of the Department of Atmosphere', 'Protection', 'Ministry of Nature Protection']
需修正为:
['Mr. Aram GABRIELYAN', 'Head of the Department of Atmosphere Protection', 'Ministry of Nature Protection']
另一示例:
原始拆分结果:
['H.E. Ms. Penelope A. WENSLEY', 'Ambassador and Permanent Representative', 'Permanent Mission of Australia to the', 'United Nations, New York']
需修正为:
['H.E. Ms. Penelope A. WENSLEY', 'Ambassador and Permanent Representative', 'Permanent Mission of Australia to the United Nations, New York']
常规正则方法无法解决这类问题,咨询是否可借助NLP技术完成文本合并。
可行的NLP解决方案
完全可以通过NLP技术解决这类文本合并问题,核心是判断相邻拆分片段是否属于同一语义单元,具体实现思路如下:
预训练语言模型语义判断
用BERT、RoBERTa等预训练模型计算语义连贯性:可以将相邻片段合并前后的文本输入模型,对比语义相似度;也可以构造二分类任务,让模型直接判断两个相邻片段是否应该合并(输入片段对,输出合并/不合并标签)。这类模型能捕捉上下文语义,准确判断片段是否属于同一完整表述。命名实体识别(NER)辅助合并
针对这类包含姓名、职位、机构的文本,先通过NER模型识别实体类型(如姓名、职位、组织)。比如示例中“Head of the Department of Atmosphere”和“Protection”同属职位实体,就可以合并为完整职位名称;“Permanent Mission of Australia to the”与“United Nations, New York”同属机构实体,合并后得到完整机构名。规则+NLP混合方案
先用简单规则过滤明确不需要合并的情况(比如片段结尾是句号、感叹号等终结标点,或是完整的姓名/机构实体);对模糊场景(如片段结尾是介词、冠词,比如示例中的“the”),再用NLP模型验证合并后的语义合理性,兼顾效率与准确性。序列标注端到端处理
将拆分后的片段序列作为输入,给每个片段标注“需合并(B)”或“独立单元(E)”标签,训练BiLSTM-CRF这类序列标注模型,让模型自动识别连续的待合并片段。训练数据可通过手动标注一批案例,或用数据增强生成更多样本。
内容的提问来源于stack exchange,提问作者Rakesh Emuru

