如何从OneHotEncoder获取特征名并写入Pandas DataFrame(报错求助)
解决独热编码后DataFrame形状不匹配的报错
问题原因
OneHotEncoder.fit_transform()返回的是scipy稀疏矩阵,直接传入pd.DataFrame()时,Pandas会将整个稀疏矩阵视为单个列,导致实际数据形状为(1000,1),但你通过get_feature_names()获取了20个列名,两者形状不匹配触发ValueError。
解决方案
方法1:将稀疏矩阵转为密集数组
通过toarray()方法把稀疏矩阵转换为普通numpy数组,再传入DataFrame:
encode = OneHotEncoder() encoded_cols = encode.fit_transform(data[['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose']]) cols = encode.get_feature_names(['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose']) # 转换为密集数组后创建DataFrame df_encode = pd.DataFrame(encoded_cols.toarray(), columns=cols)
方法2:直接返回密集数组(sklearn 1.0+)
初始化编码器时设置sparse_output=False,让fit_transform()直接返回密集数组,省去转换步骤:
# 初始化编码器时指定返回密集数组 encode = OneHotEncoder(sparse_output=False) encoded_cols = encode.fit_transform(data[['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose']]) cols = encode.get_feature_names(['Sex', 'Housing', 'Saving accounts', 'Checking account', 'Purpose']) df_encode = pd.DataFrame(encoded_cols, columns=cols)
注意:若使用旧版本sklearn,
sparse_output参数名为sparse,替换为sparse=False即可。
内容的提问来源于stack exchange,提问作者BADREDDINE BALAJ
相关产品推荐
相关产品推荐

