You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何训练/调优模型从判决书文本中提取减刑后刑期信息?

判决书减刑后刑期提取方案:数据预处理、模型选择与训练调优

一、数据预处理

1. 数据集标注

先将英文判决书翻译成中文示例:

被告人因持械抢劫罪名成立,被判处有期徒刑10年,并处罚金5美元及相关费用。考虑到被告人配合调查且无前科,刑期减至自本判决生效之日起有期徒刑5年。

针对所有判决书文本,人工标注减刑后刑期的完整有效片段,比如上述示例中标注「自本判决生效之日起有期徒刑5年」。标注规则需统一:必须包含刑期时长、执行起始时间等核心信息,禁止只提取数字或半截内容。

2. 文本清洗

  • 移除文本中的乱码、页码、冗余标点等无关内容
  • 统一法律术语表述:将「牢狱」「监禁」统一为「有期徒刑」,「生效日」统一为「判决生效之日」,减少模型语义理解干扰

3. 数据划分

按7:2:1比例拆分训练集、验证集、测试集,确保各集合的案件类型、减刑原因分布均匀,避免某类样本过度集中导致模型偏科

二、模型选择

1. 首选法律领域预训练模型

  • ERNIE-Law:针对法律文本预训练的模型,内置法律术语知识库,能精准捕捉判决书里的语境差异(比如区分原判刑期和减刑后刑期的表述逻辑)
  • BERT-base中文微调版:通用预训练模型,适配性强,通过微调后可胜任法律文本的细粒度抽取任务

2. 轻量备选方案

如果算力有限,可选用BiLSTM-CRF:基于循环神经网络的序列标注模型,训练速度快,适合中小规模数据集

三、训练与调优

1. 核心训练设置

  • 采用IOB序列标注任务:将减刑后刑期的每个字符标注为「B-TIME」「I-TIME」,其余字符标注为「O」
  • 损失函数用交叉熵损失,优化器选AdamW,初始学习率设为2e-5,batch size根据算力选8或16

2. 针对性调优策略

  • 解决过拟合:加入Dropout层(概率0.1-0.2),启用早停机制——当验证集F1值连续3轮未提升时,立即停止训练
  • 强化语义区分:在训练集中补充大量「原判刑期与减刑后刑期并存」的样本,让模型学会识别「刑期减至」这类关键触发词
  • 超参数优化:用网格搜索调整学习率(1e-5~5e-5)、Dropout概率,选取验证集F1值最高的参数组合

3. 评估指标

以F1值为核心评估标准,同时关注精确率(避免误提取原判刑期)和召回率(避免漏提取减刑后刑期),确保模型的抽取准确性和完整性

四、推理输出处理

模型输出标注为「B-TIME」「I-TIME」的字符序列后,直接拼接成完整句子即可,比如示例中直接输出「自本判决生效之日起有期徒刑5年」;若判决书中无减刑相关内容,输出「无减刑信息」

内容的提问来源于stack exchange,提问作者Cracken377

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.12 23:15:30