You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从清洗后语句中筛选有效BI-Gram?求技术实现思路

过滤无效BI-Gram短语的实用方案

1. 基于词性组合规则过滤

先对每个词标注词性,只保留符合有效短语词性组合的BI-Gram:

  • 示例中,Digital Transformation的词性是名词+名词(NN+NN),这类组合通常是稳定的有效术语;
  • 而Xyz inc heavily是专有名词+专有名词+副词(NNP+NNP+RB)、heavily Investing是副词+动词(RB+VBG)、investing Digital是动词+名词(VBG+NN),这些组合不符合常见的有效短语词性逻辑,可直接过滤;
  • 可根据业务领域调整规则,比如额外保留形容词+名词(JJ+NN)、专有名词+普通名词(NNP+NN)等组合。

2. 基于语料库统计的互信息(MI)过滤

计算BI-Gram中两个词的互信息值,值越高说明两词关联性越强,越可能是有效短语:

  • 计算方式:MI(x,y) = log2(P(x,y)/(P(x)*P(y))),其中P(x,y)是该BI-Gram在语料库中出现的概率,P(x)和P(y)是单个词的出现概率;
  • 设定合理阈值,只保留互信息值高于阈值的BI-Gram。比如在通用或数字化领域语料库中,Digital Transformation的互信息值会远高于其他几个无效组合。

3. 基于领域术语库匹配

如果是特定领域的场景,预先构建或引入该领域的标准术语库,直接匹配提取出的BI-Gram:

  • 若BI-Gram完全匹配术语库中的条目,则判定为有效;
  • 示例中Digital Transformation属于数字化转型领域的标准术语,会被匹配命中,其余组合则不会。

4. 基于点互信息(PMI)结合频率过滤

同时结合BI-Gram的出现频率和关联度进行过滤:

  • 先过滤掉出现频率极低的BI-Gram,避免偶然出现的低频次组合干扰判断;
  • 再对剩余组合计算PMI值,保留值高于阈值的结果,兼顾关联性和实际使用场景的合理性。

内容的提问来源于stack exchange,提问作者ashwar hussain

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.25 12:27:40