Pandas DataFrame中lambda多条件函数处理列值报错求解
代码报错原因
你的apply语句漏了axis=1参数。pandas中DataFrame.apply()默认按列遍历(axis=0),此时lambda接收到的x是整列数据,不是单行记录,无法按行判断Remaining的取值,自然会报错。
就算补上axis=1让apply按行遍历,这种逐行循环的写法性能很差,pandas有原生向量化方案,运行效率高得多。
正确实现代码
直接用布尔筛选用向量化逻辑处理,不需要逐行循环:
import pandas as pd # 构造测试数据 df = pd.DataFrame({ 'Total': [100, 150], 'Retired': [10, 160], 'Cancelled': [20, 30] }) # 初始计算Remaining df['Remaining'] = df['Total'] - df['Retired'] - df['Cancelled'] # 筛选出Remaining为负的行 neg_mask = df['Remaining'] < 0 # 修正对应行的Total值 df.loc[neg_mask, 'Total'] = df.loc[neg_mask, 'Retired'] + df.loc[neg_mask, 'Cancelled'] # 重新计算Remaining即可得到结果,也可以直接把对应行Remaining赋值为0,效果一致 df['Remaining'] = df['Total'] - df['Retired'] - df['Cancelled']
运行后得到的结果完全符合预期:
| Total | Retired | Cancelled | Remaining |
|---|---|---|---|
| 100 | 10 | 20 | 70 |
| 190 | 160 | 30 | 0 |
补充:如果一定要用你原来的apply写法,只需要补上
axis=1即可正常运行,但性能远低于上面的向量化方案,不推荐使用:df['Total'] = df.apply(lambda x: x['Retired'] + x['Cancelled'] if x['Remaining'] < 0 else x['Total'], axis=1) df['Remaining'] = df['Total'] - df['Retired'] - df['Cancelled']
内容的提问来源于stack exchange,提问作者pythong
相关产品推荐
相关产品推荐

