能否使用NER识别文本中的特定信息?是否有更适配的技术方案?
问题解答
关于NER是否能完成你的需求
- 示例1的主题识别需求完全可以通过自定义NER实现:你只需要新增一类
TOPIC实体标签,标注对应语料后训练基础NER模型即可达到预期效果。 - 示例2的参数-占比组合识别无法仅靠原生NER直接完成:原生NER的能力边界是识别文本中不同类型的实体片段,只会给对应文本span打实体类型标签,本身不具备实体关联能力,最多能帮你分别标出所有
PARAMETER类实体和PERCENTAGE类实体,无法直接输出两者的绑定组合。
如果一定要基于NER实现该需求,你可以在NER输出两类实体的基础上,新增轻量的规则匹配或短距离关系判断逻辑,把语义对应的参数和占比绑定,也能拿到你要的组合结果,但这种方案在句式复杂、实体距离远的场景下准确率会下降。
更适配该场景的技术方案
你可以根据自己的业务场景选择更合适的方案:
- 如果业务文本句式固定度高:优先用正则+规则匹配实现,无需训练模型,维护成本低、准确率可控,适配结构化程度高的文本场景。
- 如果业务文本句式多变、规则覆盖成本高:优先选择关系抽取方案,你可以把任务定义为抽取<参数, 占比对应, 百分比>类型的三元组,微调轻量预训练模型(比如BERT-base)即可实现,小样本标注就能拿到比NER加后处理更高的准确率,也不需要维护大量规则。
如果同时需要实现主题识别和参数占比抽取两个需求,也可以采用多任务学习框架,让单个模型同时完成实体抽取和关系抽取任务,端到端输出你需要的所有结果。
内容的提问来源于stack exchange,提问作者Tiago Bachiega de Almeida
相关产品推荐
相关产品推荐

