You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从已训练的Arabert情感分析模型提取带极性词典?传统ML可行吗?

从情感分析模型提取带极性标注的习得词典方案

一、从已训练的Arabert模型中提取词典的方法

针对你训练的Arabert这类Transformer模型,有几种可行的提取思路:

  • 基于注意力权重的筛选:Transformer的注意力机制能捕捉词与情感决策的关联。你可以统计所有训练/测试样本中,[CLS] token对每个输入token的平均注意力权重,权重越高说明该词对情感判断的贡献越大。结合样本的真实情感标签,给这些高权重词标注对应的正负极性。
  • 利用token嵌入的极性映射:提取模型输出的token嵌入向量,将这些向量与样本的情感标签结合,训练一个简单的二分类器(比如逻辑回归)来判断单个token的极性;或者计算正负情感样本的嵌入中心,通过token嵌入到两个中心的距离来标注极性(距离正中心更近则为正向词)。
  • 基于梯度的词重要性计算:计算模型最终情感输出对每个token嵌入的梯度值,梯度的绝对值越大,说明该词对预测结果的影响越强。同时根据梯度的正负判断极性:正梯度对应正向情感贡献,负梯度对应负向情感贡献。

二、用传统机器学习模型训练并提取词典

如果深度学习模型的提取方式不符合需求,传统模型的特征权重天然适合生成情感词典:

  • 基于线性模型的特征系数:训练逻辑回归、线性SVM这类模型,采用TF-IDF或词袋作为输入特征。训练完成后,提取模型的特征系数(逻辑回归的coef_、线性SVM的coef_),系数为正且绝对值大的是正向情感词,系数为负且绝对值大的是负向情感词。
  • 互信息/卡方检验筛选:先计算每个词与情感标签的互信息值或卡方统计量,筛选出与情感高度相关的词。再对比这些词在正负样本中的出现频率:正样本中占比远高于负样本的标注为正向词,反之则为负向词。
  • 朴素贝叶斯的概率比值:训练朴素贝叶斯分类器后,计算每个词在正负类别下的条件概率比值(P(word|positive)/P(word|negative))。比值大于1的为正向词(值越大极性越强),比值小于1的为负向词(值越小极性越强)。

内容的提问来源于stack exchange,提问作者Reem

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.10 11:57:50