You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从OneHotEncoder获取特征名并写入Pandas DataFrame(报错求助)

解决独热编码后DataFrame形状不匹配的报错

问题原因

OneHotEncoder.fit_transform()返回的是scipy稀疏矩阵,直接传入pd.DataFrame()时,Pandas会将整个稀疏矩阵视为单个列,导致实际数据形状为(1000,1),但你通过get_feature_names()获取了20个列名,两者形状不匹配触发ValueError。

解决方案

方法1:将稀疏矩阵转为密集数组

通过toarray()方法把稀疏矩阵转换为普通numpy数组,再传入DataFrame:

encode = OneHotEncoder()
encoded_cols = encode.fit_transform(data[['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose']])
cols = encode.get_feature_names(['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose'])
# 转换为密集数组后创建DataFrame
df_encode = pd.DataFrame(encoded_cols.toarray(), columns=cols)

方法2:直接返回密集数组(sklearn 1.0+)

初始化编码器时设置sparse_output=False,让fit_transform()直接返回密集数组,省去转换步骤:

# 初始化编码器时指定返回密集数组
encode = OneHotEncoder(sparse_output=False)
encoded_cols = encode.fit_transform(data[['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose']])
cols = encode.get_feature_names(['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose'])
df_encode = pd.DataFrame(encoded_cols, columns=cols)

注意:若使用旧版本sklearn,sparse_output参数名为sparse,替换为sparse=False即可。

内容的提问来源于stack exchange,提问作者BADREDDINE BALAJ

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.24 03:07:13