数据预处理疑问:为何DataFrame子集的列类型与数量发生变化?
问题原因分析与验证方案
核心原因
你遇到的列数和类型突变,本质是分类变量被自动转换为独热编码(One-Hot Encoding)的二进制列,常见触发场景如下:
- 误执行独热编码代码:你可能在脚本/Notebook中先运行了
pd.get_dummies(student_sub_set[...])或sklearn的OneHotEncoder等编码逻辑,且将结果赋值给了X_stud,后续执行直接选列的代码时,变量名重复导致覆盖失败(或你混淆了执行顺序),最终看到的是编码后的结果。 - 交互式环境的执行顺序错误:在Jupyter Notebook等环境中,若先运行了编码赋值的单元格,再运行选列的单元格,全局变量会保留之前的编码结果,导致你误以为是选列操作的输出。
- 罕见的自定义重载:若
student_sub_set被自定义函数/扩展库重载了选列逻辑,自动展开分类列,但这种情况概率极低。
验证与排查步骤
- 按顺序重新执行代码:先运行
student_sub_set = student[...].dropna(),接着运行student_sub_set.info()确认原数据是21列,然后立即执行X_stud = student_sub_set[你的列列表],再查看X_stud.info(),看是否恢复正常。 - 检查列名特征:打印
X_stud.columns,如果新增列是acad_lang_home_xxx、sex_xxx这类带分类值后缀的命名,直接证明发生了独热编码。 - 排查变量冲突:在Notebook中执行
%who命令查看全局变量,确认是否有其他编码后的变量被误命名为X_stud。
内容的提问来源于stack exchange,提问作者Narges Ghanbari
相关产品推荐
相关产品推荐

