pandas使用.loc切分数据集出现缺失标签告警如何解决?
问题根源
你遇到的报错和complete_df内部是否存在空值无关,核心原因是:StratifiedShuffleSplit等分层切分类的split方法返回的train_set、test_set是数据集的整数位置索引,而pandas的.loc属性是基于行标签(index)取值的。只有当你的complete_df从未做过过滤、排序、删除行、拼接等操作,行标签是默认的0开始连续递增整数时,你的写法才能正常运行,只要行标签和位置索引不匹配,就会触发该告警,后续甚至直接抛出KeyError。
解决方案
方案1(最简便,无需修改原有逻辑)
将.loc替换为基于位置索引取值的.iloc即可,修改后的代码如下:
for train_set, test_set in stratified.split(complete_df, complete_df["loan_condition_int"]): stratified_train = complete_df.iloc[train_set] stratified_test = complete_df.iloc[test_set]
方案2(坚持使用.loc的场景)
在切分前先重置数据集的行标签,保证行标签和位置索引完全对应:
# 重置索引,drop=True表示不保留原来的索引列 complete_df = complete_df.reset_index(drop=True) # 后续执行你原来的切分代码即可 for train_set, test_set in stratified.split(complete_df, complete_df["loan_condition_int"]): stratified_train = complete_df.loc[train_set] stratified_test = complete_df.loc[test_set]
方案3(简化切分逻辑)
如果不需要自定义多折切分,可以直接用带分层参数的train_test_split完成切分,代码更简洁:
from sklearn.model_selection import train_test_split # test_size根据你的需求调整,比如0.2代表测试集占20% stratified_train, stratified_test = train_test_split( complete_df, stratify=complete_df["loan_condition_int"], test_size=0.2, random_state=42 # 固定随机种子保证结果可复现 )
内容的提问来源于stack exchange,提问作者PrabodhanaJ
相关产品推荐
相关产品推荐

