You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

LabelEncoder无法编码字符串?编码Pandas非数值列时报错求助

解决Pandas非数值列编码时的TypeError问题

看起来你在给DataFrame的非数值列编码时遇到了类型错误,我来帮你分析问题并给出修复方案:

错误原因分析

你的代码里有几个关键问题导致了这个报错:

  1. 统一填充缺失值导致类型混乱:df = df.fillna('0')把所有列的NaN都替换成字符串'0',如果原本的数值列存在缺失,这会把数值列的类型从数值型变成object(因为混合了数值和字符串)。这些被污染的列会被select_dtypes(exclude=[np.number])选中,而LabelEncoder处理混合类型(比如int和str共存)的列时,内部的比较操作会抛出TypeError: '<' not supported between instances of 'int' and 'str'。
  2. 编码结果未赋值回DataFrame:encoder_dict[col].fit_transform(df_train_enc[col])只是计算了编码后的数组,但没有把结果存回DataFrame,等于白做了编码操作。
  3. 潜在的数据泄露风险:虽然你先填充再分割数据集,但如果后续用整个数据集的编码器转换测试集,会导致数据泄露(不过当前错误还没到这一步)。

修复后的完整代码

下面是调整后的代码,解决了上述所有问题:

import pandas as pd
import numpy as np
from sklearn.preprocessing import LabelEncoder

# 替换成你的实际数据加载代码
# df = pd.read_csv("your_dataset.csv")

# 1. 区分数值列和非数值列,分别填充缺失值
numeric_cols = df.select_dtypes(include=[np.number]).columns
categorical_cols = df.select_dtypes(exclude=[np.number]).columns

# 数值列用0填充(也可以用均值/中位数,按需选择)
df[numeric_cols] = df[numeric_cols].fillna(0)
# 非数值列用语义化字符串填充(比如'Unknown',比'0'更清晰)
df[categorical_cols] = df[categorical_cols].fillna('Unknown')

# 2. 分割训练集和测试集,用copy()避免引用原数据
msk = np.random.rand(len(df)) < 0.8
df_train = df[msk].copy()
df_test = df[~msk].copy()

# 3. 初始化编码器,对非数值列进行编码
encoder_dict = {}
for col in categorical_cols:
    encoder = LabelEncoder()
    # 只在训练集上拟合编码器,防止数据泄露
    df_train[col] = encoder.fit_transform(df_train[col])
    encoder_dict[col] = encoder
    # 用训练集拟合好的编码器转换测试集
    df_test[col] = encoder.transform(df_test[col])

# 现在df_train和df_test的非数值列都已转为数值类型

额外优化提示

如果你的测试集中出现了训练集从未见过的类别,LabelEncoder会直接报错。这时候可以改用OrdinalEncoder并设置handle_unknown='ignore',让未知类别被编码为NaN,后续再按需处理:

from sklearn.preprocessing import OrdinalEncoder

encoder_dict = {}
for col in categorical_cols:
    encoder = OrdinalEncoder(handle_unknown='ignore')
    # OrdinalEncoder要求输入是二维数组,所以用[[col]],之后flatten转回一维
    df_train[col] = encoder.fit_transform(df_train[[col]]).flatten()
    encoder_dict[col] = encoder
    df_test[col] = encoder.transform(df_test[[col]]).flatten()

内容的提问来源于stack exchange,提问作者lte__

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.25 03:32:48