作为语言特征的熵计算:讽刺检测论文词熵计算相关问题咨询
反讽检测论文词汇熵相关内容解释
背景说明
你提及的反讽检测(Sarcasm Detection)领域论文《基于混合注意力的长短期记忆网络反讽识别》(原标题:Hybrid attention-based Long Short-Term Memory network for sarcasm identification)中,针对句子内词汇熵的定义和公式存在表述模糊的问题,以下结合任务场景做明确解读:
原论文表述引用
词的熵定义为词汇相对于所在句子的随机程度,计算公式为:
S(A/B) = (p(ai | bj) * log(p(ai))) / p(bj)
其中S(A/B)代表词汇'A'相对于句子'B'的概率,p(ai | bj)指给定bj条件下ai的概率。
公式与参数含义详解
- 首先修正原论文的表述错误:$S(A/B)$并非概率,而是这篇论文自定义的词汇语境熵,用来衡量单个词汇在所属句子中的语义突兀程度,反讽表达通常存在常规语义逻辑矛盾,这类高熵词汇就是核心分类特征。
ai:待计算熵值的目标词汇,对应公式里的词汇A的具体实例bj:目标词汇所属的句子,对应公式里的句子B的具体实例p(ai):目标词汇ai在全训练语料中的全局出现概率,数值越高说明该词本身的通用使用频率越高p(bj):目标句子bj在训练语料中的出现概率,实际计算时通常简化为句子内所有词汇的联合概率近似值p(ai | bj):当前句子bj的语境下,对应位置出现目标词汇ai的条件概率,通常通过n-gram模型或预训练语言模型计算得到
公式实际作用说明
该公式本质是结合词汇的全局通用属性和语境适配性计算违和度:当一个高频常用词出现在不符合逻辑的语境中时(比如吐槽堵车时说「我可太开心了」里的「开心」),p(ai | bj)数值极低,代入公式后得到的熵值会远高于常规搭配的词汇,模型就可以通过这类特征识别出反讽表达的语义矛盾点。
内容的提问来源于stack exchange,提问作者ragingmartyr
相关产品推荐
相关产品推荐

