为何复制Pandas DataFrame后修改列名会影响原DataFrame?
问题解析:深拷贝后修改列名仍影响原DataFrame的原因
嘿,这个坑很多人都踩过!你之所以遇到这个问题,核心原因是你直接操作了列名数组的底层内存引用,哪怕用了deep=True的深拷贝也没用。
让我拆解一下:
- 当你执行
df_copy = df.copy(deep=True)时,Pandas确实会深拷贝DataFrame的数据和列对象本身,但columns.values返回的是一个numpy数组的视图,而非独立副本。这个视图和原DataFrame列名的底层numpy数组共享内存空间。 - 所以当你执行
df_copy.columns.values[0] = 'y'时,你其实是直接修改了内存中的原始值,自然会同步影响到原df的列名。
正确的修改方式
想要只修改副本的列名且不影响原DataFrame,你需要通过Pandas提供的安全接口来修改,而不是直接操作底层的values属性:
方法1:直接重新赋值列名
import pandas as pd df = pd.DataFrame({'x': [0, 1]}) df_copy = df.copy(deep=True) df_copy.columns = ['y'] # 用这种方式修改列名 print(df.columns) # 输出: Index(['x'], dtype='object') print(df_copy.columns) # 输出: Index(['y'], dtype='object')
方法2:使用rename方法
如果你需要批量修改列名,rename会更灵活:
import pandas as pd df = pd.DataFrame({'x': [0, 1]}) df_copy = df.copy(deep=True) df_copy.rename(columns={'x': 'y'}, inplace=True) # 原地修改副本列名 print(df.columns) # 输出: Index(['x'], dtype='object')
这两种方式都会真正修改副本的列名对象,不会触及原DataFrame的底层内存,所以能达到你预期的效果。
内容的提问来源于stack exchange,提问作者bbiegel
相关产品推荐
相关产品推荐

