如何为sklearn的CountVectorizer设置max_features?遇语法错误求解
解决CountVectorizer设置max_features的语法错误问题
嘿,我一眼就发现问题所在啦!你这段代码的语法错误完全是个小疏忽——在ngram_range=(1,1)后面漏掉了一个逗号,导致Python无法正确识别后续的max_features参数。
你看,修正后的代码应该是这样:
vectorizer = CountVectorizer( analyzer='word', lowercase=False, tokenizer=None, preprocessor=None, min_df=2, ngram_range=(1,1), # 这里补上逗号就没问题啦 max_features=1000 )
其实CountVectorizer和你之前用的TfidfVectorizer一样,完全支持max_features参数,它的作用也是限制最终生成的词汇表最多包含指定数量的高频特征。这次只是因为参数间的分隔符缺失才导致报错,补上逗号就能正常运行啦。
内容的提问来源于stack exchange,提问作者AfterFray
相关产品推荐
相关产品推荐

