You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

pandas使用.loc切分数据集出现缺失标签告警如何解决?

问题根源

你遇到的报错和complete_df内部是否存在空值无关,核心原因是:
StratifiedShuffleSplit等分层切分类的split方法返回的train_set、test_set是数据集的整数位置索引,而pandas的.loc属性是基于行标签(index)取值的。只有当你的complete_df从未做过过滤、排序、删除行、拼接等操作,行标签是默认的0开始连续递增整数时,你的写法才能正常运行,只要行标签和位置索引不匹配,就会触发该告警,后续甚至直接抛出KeyError。


解决方案

方案1(最简便,无需修改原有逻辑)

将.loc替换为基于位置索引取值的.iloc即可,修改后的代码如下:

for train_set, test_set in stratified.split(complete_df, complete_df["loan_condition_int"]):
    stratified_train = complete_df.iloc[train_set]
    stratified_test = complete_df.iloc[test_set]

方案2(坚持使用.loc的场景)

在切分前先重置数据集的行标签,保证行标签和位置索引完全对应:

# 重置索引,drop=True表示不保留原来的索引列
complete_df = complete_df.reset_index(drop=True)
# 后续执行你原来的切分代码即可
for train_set, test_set in stratified.split(complete_df, complete_df["loan_condition_int"]):
    stratified_train = complete_df.loc[train_set]
    stratified_test = complete_df.loc[test_set]

方案3(简化切分逻辑)

如果不需要自定义多折切分,可以直接用带分层参数的train_test_split完成切分,代码更简洁:

from sklearn.model_selection import train_test_split
# test_size根据你的需求调整,比如0.2代表测试集占20%
stratified_train, stratified_test = train_test_split(
    complete_df, 
    stratify=complete_df["loan_condition_int"],
    test_size=0.2,
    random_state=42 # 固定随机种子保证结果可复现
)

内容的提问来源于stack exchange,提问作者PrabodhanaJ

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.28 06:45:04