如何从清洗后语句中筛选有效BI-Gram?求技术实现思路
过滤无效BI-Gram短语的实用方案
1. 基于词性组合规则过滤
先对每个词标注词性,只保留符合有效短语词性组合的BI-Gram:
- 示例中,
Digital Transformation的词性是名词+名词(NN+NN),这类组合通常是稳定的有效术语; - 而
Xyz inc heavily是专有名词+专有名词+副词(NNP+NNP+RB)、heavily Investing是副词+动词(RB+VBG)、investing Digital是动词+名词(VBG+NN),这些组合不符合常见的有效短语词性逻辑,可直接过滤; - 可根据业务领域调整规则,比如额外保留形容词+名词(JJ+NN)、专有名词+普通名词(NNP+NN)等组合。
2. 基于语料库统计的互信息(MI)过滤
计算BI-Gram中两个词的互信息值,值越高说明两词关联性越强,越可能是有效短语:
- 计算方式:
MI(x,y) = log2(P(x,y)/(P(x)*P(y))),其中P(x,y)是该BI-Gram在语料库中出现的概率,P(x)和P(y)是单个词的出现概率; - 设定合理阈值,只保留互信息值高于阈值的BI-Gram。比如在通用或数字化领域语料库中,
Digital Transformation的互信息值会远高于其他几个无效组合。
3. 基于领域术语库匹配
如果是特定领域的场景,预先构建或引入该领域的标准术语库,直接匹配提取出的BI-Gram:
- 若BI-Gram完全匹配术语库中的条目,则判定为有效;
- 示例中
Digital Transformation属于数字化转型领域的标准术语,会被匹配命中,其余组合则不会。
4. 基于点互信息(PMI)结合频率过滤
同时结合BI-Gram的出现频率和关联度进行过滤:
- 先过滤掉出现频率极低的BI-Gram,避免偶然出现的低频次组合干扰判断;
- 再对剩余组合计算PMI值,保留值高于阈值的结果,兼顾关联性和实际使用场景的合理性。
内容的提问来源于stack exchange,提问作者ashwar hussain
相关产品推荐
相关产品推荐

