You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Spark IDF初始化报错:意外关键字参数'inputCol'问题咨询

解决Spark IDF初始化参数错误的方案

错误原因分析

报错TypeError: IDF.__init__() got an unexpected keyword argument 'inputCol'主要有两个核心问题:

  • 参数名拼写错误:你使用了复数形式的outputCols,但Spark ML的IDF类初始化参数中,输出列参数是单数的outputCol。
  • 可能导入了错误的IDF类:如果导入的是旧版RDD API的pyspark.mllib.feature.IDF,它的参数定义和ML API完全不同,也会触发此错误。

修正步骤

  1. 确保导入正确的Spark ML模块的IDF:
from pyspark.ml.feature import IDF
  1. 修正参数名,将outputCols改为outputCol,保留正确的inputCol和minDocFreq参数:

修正后的完整代码:

# 初始化IDF,注意输出列参数为单数outputCol
idf = IDF(minDocFreq=3, inputCol="filtered", outputCol="filtered_idf")
idfModel = idf.fit(regexTokenized)
TFIDF_featurized = idfModel.transform(regexTokenized)

验证说明

执行修正后的代码后,IDF会正常读取inputCol指定的分词列,计算逆文档频率,并将结果输出到outputCol指定的列中,不会再出现参数不匹配的类型错误。

内容的提问来源于stack exchange,提问作者Eben Ezer Napitu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 16:56:58