You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从句子中提取指定实体?波斯语NLP实体抽取实现咨询

波斯语购物场景实体抽取实现方案

你要完成的属于*自定义垂直场景命名实体识别(NER)*任务,预定义3类待抽取实体:product(商品实体)、unit count(数量实体)、location(消费场所实体),波斯语场景下可按以下流程实现:

1 前置准备
  • 场景数据集整理:优先收集和你的需求匹配的波斯语购物类句子,和示例格式保持一致即可。如果要训练专属小模型,需要对数据做BIO标注,标签体系设置为B-PRO、I-PRO、B-COUNT、I-COUNT、B-LOC、I-LOC、O7类即可,新手先标注300~500条就能跑出可用效果。
  • 预训练模型选型:选择波斯语专属预训练模型ParsBERT的轻量版本即可,已经提前学习了波斯语的语法、词汇特征,不用从零搭建模型。
2 微调专属模型实现(适合长期批量使用)
  • 环境配置:安装依赖工具库,执行命令:
    pip install transformers datasets evaluate seqeval
  • 数据预处理:用datasets库加载标注好的数据集,和ParsBERT的分词器做标签对齐,避免分词后实体边界和标注标签错位。
  • 模型训练:直接调用transformers库的TrainerAPI,给ParsBERT加装NER分类头,训练3~5个epoch即可收敛,基础参数建议学习率设为2e-5,batch size设为8即可,不需要复杂调参。
  • 推理封装:训练完成后导出模型,写简单的推理逻辑,把输出的BIO标签拼接成完整实体,即可得到和示例格式一致的抽取结果。
3 零代码快速验证方案

如果不需要长期批量使用,只想快速验证需求可行性,可以用通用大模型做提示词引导实现,给大模型输入固定规则即可:

你是波斯语实体抽取工具,仅从输入的波斯语购物句子中提取三个字段:product(商品)、unit count(数量)、location(购买地点),没有对应字段则填空,不要输出任何额外内容。
直接输入待抽取的波斯语句子就能得到结果,不需要标注数据和训练。

内容的提问来源于stack exchange,提问作者miladjurablu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 09:30:00