逻辑回归与SVC使用BOW、tf-idf、doc2Vec特征时是否需要特征缩放?
逻辑回归与SVC对三类文本特征的缩放必要性说明
首先明确逻辑回归(Logistic Regression)和SVC需要特征缩放的核心原因:两类模型的训练过程和效果对特征量纲高度敏感——SVC的几何间隔计算、核函数距离计算直接受特征量纲影响;逻辑回归如果用梯度下降优化,量纲不一致会大幅降低收敛速度,若模型加入L1/L2正则项,量纲更大的特征会受到更重的惩罚,最终导致模型权重偏移,效果下降。
以下分别对应三类特征给出结论:
1. BOW(词袋模型)特征
BOW的每个特征维度对应单个词在文档中的出现频次,取值均为非负整数,不同维度的取值范围差异极大,比如高频停用词的单维度取值远高于罕见词维度。
- 若使用无正则项的逻辑回归/SVC:可以不做缩放,但仍建议做缩放提升模型训练的收敛速度。
- 若使用带正则项的逻辑回归/SVC:必须做缩放,否则不同维度的量纲差异会导致正则惩罚不公平,模型无法学习到合理的权重。
- 推荐适配稀疏矩阵的
MaxAbsScaler做缩放,避免破坏BOW特征的稀疏性,降低内存占用。
2. TF-IDF特征
TF-IDF是经过逆文档频率加权的词频特征,取值为非负浮点数,虽然已经做了全局词频的校正,但不同维度的取值范围依然存在较大差异,比如罕见词的IDF值高,单次出现的TF-IDF值可能远高于普通高频词。
- 若使用无正则项的逻辑回归/SVC:可以不做缩放,同样建议做缩放提升收敛速度。
- 若使用带正则项的逻辑回归/SVC:必须做缩放,原因与BOW场景一致,避免正则惩罚偏差。
- 同样推荐用
MaxAbsScaler处理,保留TF-IDF的稀疏特性。
3. doc2Vec特征
doc2Vec是无监督训练生成的稠密低维文档向量,各维度取值为浮点数,维度之间没有明确的物理含义,分布范围差异普遍较大。
- 无论模型是否带正则项,都推荐做标准化(StandardScaler)处理:doc2Vec的特征分布差异会直接影响SVC的核函数计算效果,缩放后可以稳定提升两类模型的表现,同时加快逻辑回归的收敛速度。
内容的提问来源于stack exchange,提问作者123456
相关产品推荐
相关产品推荐

