Python替代多重嵌套if elif实现Pandas DataFrame新列赋值的方法
解决方案
直接使用Pandas原生向量化运算实现,完全不需要嵌套if和apply,执行效率远高于逐行遍历,数据量越大性能优势越明显。
方法1:直接用数值比较实现(最简最高效)
你的映射规则可以直接拆解为两次数值比较的结果相加,逻辑如下:
- 数值≤30:
>30为假、>70为假,相加得0 - 31≤数值≤70:
>30为真、>70为假,相加得1 - 数值≥71:
>30为真、>70为真,相加得2
完整代码如下:
import pandas as pd data = { 'A': [50, 90], 'B': [2, 4], 'C': [20, 80], 'D': [75, 72], } df = pd.DataFrame(data) # 选取前四列做映射后按行求和,直接赋值给E列 df['E'] = ((df[['A','B','C','D']] > 30).astype(int) + (df[['A','B','C','D']] > 70).astype(int)).sum(axis=1)
运行后df['E']的结果为[2, 3],完全符合预期。
方法2:用pd.cut实现(扩展性更好)
如果后续区间规则变复杂,可使用pd.cut做区间映射,只需修改bins和labels参数即可适配新规则:
# 定义区间和对应映射值 bins = [-1, 30, 70, 100] labels = [0, 1, 2] # 对前四列每列做区间映射后转整型,再按行求和 df['E'] = df[['A','B','C','D']].apply(lambda x: pd.cut(x, bins=bins, labels=labels)).astype(int).sum(axis=1)
注意:这里的
apply是作用于列的Pandas内置方法,不是逐行遍历,性能远高于你之前用的行级apply。
性能对比
- 行级
apply是Python层面的逐行循环,10万行数据的处理速度通常在秒级以上 - 上述两种向量化方案是底层C实现的批量运算,同规模数据处理速度在毫秒级,性能提升可达百倍以上
内容的提问来源于stack exchange,提问作者grdnryn
相关产品推荐
相关产品推荐

