You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

OCR识别法律文档后,基于nltk分词提取指定键值对的方案咨询

法律文档属性提取难题求助

我现在碰到个棘手的问题,想请教大家:

目前我要完成的任务是从OCR识别后的法律文档里,提取约40个属性的键值对,最终存储到Excel中。

已经完成的工作如下:

  • 搞定了OCR模块,能顺利将文档转换为可处理的文本
  • 用nltk完成了文本分词操作
  • 已经定义好目标属性的字典示例:
    dictionary = {
        "Lease Term":["<data in years>"], 
        "Rent" : ["<maybe float numbers>"], 
        "Car parking Spaces":["<number of parking spaces>"], 
        "Lessor Name":["<String value>"]
    }
    

现在卡在了最关键的一步:怎么精准识别并提取每个属性对应的取值?

我了解到有两个可选方案:

  1. 用正则匹配的方式对应每个属性的取值
  2. 用样本数据训练模型(我手头有700份样本,计划用其中约100份作为训练集)

但现实困境是:团队成员都是非技术背景的财务人员,要求我几天内就得完成实现。可这两个方案都需要从零学习,还要做大量手动测试,时间完全赶不上。有没有更高效、易上手的可行解决办法?

内容的提问来源于stack exchange,提问作者A Jain

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.21 03:41:17