OCR识别法律文档后,基于nltk分词提取指定键值对的方案咨询
法律文档属性提取难题求助
我现在碰到个棘手的问题,想请教大家:
目前我要完成的任务是从OCR识别后的法律文档里,提取约40个属性的键值对,最终存储到Excel中。
已经完成的工作如下:
- 搞定了OCR模块,能顺利将文档转换为可处理的文本
- 用nltk完成了文本分词操作
- 已经定义好目标属性的字典示例:
dictionary = { "Lease Term":["<data in years>"], "Rent" : ["<maybe float numbers>"], "Car parking Spaces":["<number of parking spaces>"], "Lessor Name":["<String value>"] }
现在卡在了最关键的一步:怎么精准识别并提取每个属性对应的取值?
我了解到有两个可选方案:
- 用正则匹配的方式对应每个属性的取值
- 用样本数据训练模型(我手头有700份样本,计划用其中约100份作为训练集)
但现实困境是:团队成员都是非技术背景的财务人员,要求我几天内就得完成实现。可这两个方案都需要从零学习,还要做大量手动测试,时间完全赶不上。有没有更高效、易上手的可行解决办法?
内容的提问来源于stack exchange,提问作者A Jain
相关产品推荐
相关产品推荐

