You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

咨询:基于总出现次数的NLP特征选择技术名称

问题描述

我有一个来自技术文档NLP任务的数据集,包含60,000条记录和30,000个特征,特征值为对应词汇/特征的出现次数。数据集示例如下:

RowID       Microsoft  Internet  PCI  Laptop  Google  AWS  iPhone  Chrome
1              8          2       0      0      5      1      0       0
2              0          1       0      1      1      4      1       0
3              0          0       0      7      1      0      5       0
4              1          0       0      1      6      7      5       0
5              5          1       0      0      5      0      3       1
6              1          5       0      8      0      1      0       0

-------------------------------------------------------------------------
Total          9,470     821      5     107     4,605  719    25      8
Appearance

部分词汇在全数据集中出现次数不足10次,现采用仅筛选总出现次数超过阈值(如100次)的特征的方法,请问该特征选择技术的名称是什么?

答案

这种特征选择技术叫做词频阈值过滤(Frequency-based Feature Filtering),也常被称为低词频特征移除。

它的核心逻辑是:移除在整个数据集中总出现次数低于设定阈值的特征(词汇)——这类特征通常携带的有效信息极少,反而会增加模型的计算负担、引入噪声,通过过滤它们可以精简特征空间,提升后续模型的效率与效果。

内容的提问来源于stack exchange,提问作者asmgx

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.06 06:55:56