如何基于条件替换Pandas DataFrame多列中的值?
嘿,这个问题我之前也踩过坑!其实np.where直接用在多列上会因为维度匹配问题失效,但我们有几个更贴合Pandas风格的优雅方案:
方法1:用df.loc布尔索引(最推荐)
这是Pandas原生的、可读性拉满的方式——直接定位符合条件的行和列,批量赋值:
import pandas as pd df = pd.DataFrame({'A': [1,2,3,4], 'C': [1,2,3,4], 'B': [3,4,6,6]}) # 先定义条件掩码 mask = df['B'] < 5 # 定位掩码为True的行,以及A、C列,赋值为'-' df.loc[mask, ['A', 'C']] = '-' print(df)
输出结果:
A C B 0 - - 3 1 - - 4 2 3 3 6 3 4 4 6
这个方法不仅简洁,而且性能比循环好太多,完全符合Pythonic/Pandas的风格。
方法2:调整np.where的维度适配
如果你非要用np.where,只需要把一维的掩码转换成二维,让它能和多列DataFrame广播匹配就行:
import numpy as np mask = df['B'] < 5 # 用[:, None]把一维mask转成(4,1)的二维数组,和A、C列的(4,2)维度匹配 df[['A','C']] = np.where(mask[:, np.newaxis], '-', df[['A','C']])
之前的写法失效,是因为一维的mask(长度4)无法和二维的df[['A','C']](4行2列)做广播,转成二维后就能自动适配每一列了。
方法3:apply配合lambda(适合复杂逻辑)
如果你的赋值逻辑更复杂,也可以用apply遍历列处理,但性能不如前两种,仅作参考:
df[['A','C']] = df[['A','C']].apply(lambda col: np.where(mask, '-', col))
总的来说,方法1是最优解,既符合Pandas的设计思路,又清晰易懂。
内容的提问来源于stack exchange,提问作者honetkri
相关产品推荐
相关产品推荐

