基于其他列条件更新Pandas DataFrame列及复制警告疑问
搞定Pandas新增列时的复制警告问题
咱们先唠唠这个SettingWithCopyWarning警告到底咋回事:
- 要是你这df是自己直接创建的(就像你示例里那样用
pd.DataFrame(...)生成的),那这个警告基本是Pandas的“过度操心”,理论上忽略也没问题,但咱还是用更规范的写法把它消了,看着舒服也避免后续踩坑。 - 但如果你的df是从某个大DataFrame里切出来的(比如
df = 原数据[['A','B']]),那这个警告就是在提醒你:你可能在改原数据的“视图”,不是独立的副本,后续操作说不定会出奇怪的问题。
给你俩靠谱的解决办法
办法1:用assign()方法加新列
这个方法会返回一个全新的DataFrame,从根儿上避免视图/副本的纠结,代码还挺优雅:
import pandas as pd df = pd.DataFrame({'A':['x','','x',''], 'B':['x','x','','']}) # 新增msg列,初始值设为空字符串 df = df.assign(msg='')
办法2:先明确做个副本(如果df是切片来的)
要是你的df是从别的DataFrame切出来的,先给它整个副本,再加列就不会有警告了:
# 假设df是从原数据切片得到的,先搞个副本 df = big_df[['A','B']].copy() # 现在加列就安心了 df['msg'] = ''
那啥时候能忽略警告?
只有当你拍胸脯确认当前的df是完全独立的副本(比如自己直接创建的,或者已经用.copy()处理过),这时候警告就是Pandas瞎操心,完全可以无视。但为了代码稳当,还是推荐用上面的规范写法,省得以后维护的时候自己都懵。
像你示例里的代码,因为df是直接创建的,其实不会有数据乱掉的问题,但警告看着闹心,换成assign()就清爽多啦。
内容的提问来源于stack exchange,提问作者Robert
相关产品推荐
相关产品推荐

