咨询:基于总出现次数的NLP特征选择技术名称
问题描述
我有一个来自技术文档NLP任务的数据集,包含60,000条记录和30,000个特征,特征值为对应词汇/特征的出现次数。数据集示例如下:
RowID Microsoft Internet PCI Laptop Google AWS iPhone Chrome 1 8 2 0 0 5 1 0 0 2 0 1 0 1 1 4 1 0 3 0 0 0 7 1 0 5 0 4 1 0 0 1 6 7 5 0 5 5 1 0 0 5 0 3 1 6 1 5 0 8 0 1 0 0 ------------------------------------------------------------------------- Total 9,470 821 5 107 4,605 719 25 8 Appearance
部分词汇在全数据集中出现次数不足10次,现采用仅筛选总出现次数超过阈值(如100次)的特征的方法,请问该特征选择技术的名称是什么?
答案
这种特征选择技术叫做词频阈值过滤(Frequency-based Feature Filtering),也常被称为低词频特征移除。
它的核心逻辑是:移除在整个数据集中总出现次数低于设定阈值的特征(词汇)——这类特征通常携带的有效信息极少,反而会增加模型的计算负担、引入噪声,通过过滤它们可以精简特征空间,提升后续模型的效率与效果。
内容的提问来源于stack exchange,提问作者asmgx
相关产品推荐
相关产品推荐

