如何为DataFrame新增列且不触发SettingWithCopyWarning警告
解决pandas的SettingWithCopyWarning警告问题
哈哈,这个警告我太熟了!不少刚用pandas的朋友都会踩这个坑~咱们先搞清楚为啥会出现这个警告,再给你彻底解决它。
问题根源
你执行df = df[~df.isnull()]的时候,pandas并没有默认生成一个全新的独立DataFrame副本,而是可能返回了原DataFrame的视图——简单说就是这个新df和原数据共享内存空间。这时候你给它新增列df['b'] = False,pandas就会犯嘀咕:“你到底是想修改原数据的这个子集,还是想修改一个完全独立的新DataFrame?”为了避免你误操作原数据,就抛出了这个SettingWithCopyWarning。
两种靠谱的解决方法
方法1:显式创建副本(最稳妥)
敲黑板!在筛选操作后面加上.copy(),明确告诉pandas:“我要一个全新的、独立的DataFrame!”这样后续的修改就和原数据彻底没关系了,警告自然消失:
# 精准筛选列a中不含NaN的行,并创建独立副本 df = df[~df['a'].isnull()].copy() # 现在新增列完全没问题 df['b'] = False
(这里建议你指定df['a'].isnull(),而不是df.isnull(),后者会检查所有列的NaN,可能不是你想要的结果哦)
方法2:用.loc链式操作(pandas官方推荐)
pandas更推荐用.loc来进行行选择和列操作,这种方式能明确你的操作对象,避免模糊的视图/副本问题:
# 先筛选非NaN行并创建副本,再新增列 df = df.loc[~df['a'].isnull(), :].copy() df['b'] = False # 或者一步到位:直接给符合条件的行新增列赋值(如果不需要保留原df的话) df.loc[~df['a'].isnull(), 'b'] = False
第二种一步到位的方式,会直接在原DataFrame中给非NaN的行设置b=False,NaN行的b列会是NaN,如果你需要统一处理,可以后续再调整。
内容的提问来源于stack exchange,提问作者Marses
相关产品推荐
相关产品推荐

