能否用df.where替代迭代实现DataFrame条件列值乘法运算?
优化pandas赋值:告别低效迭代,用向量化操作更高效
Hey there! 看你现在用iterrows()循环的方式来根据street_typ的不同值给v_length列赋值,其实完全没必要这么做——pandas的核心优势就是向量化操作,不仅代码更简洁,运行效率还能提升一大截,尤其是数据量大的时候,差距特别明显。
先说说你现有代码的小问题
你现在的写法里,for index, row in street_cal.iterrows():这个循环其实是多余的——你在循环内部做的是全表范围的loc赋值,相当于每循环一次就把整个表的对应类型重新赋值一遍,完全浪费了循环的意义,直接去掉循环,保留下面的loc语句就可以正常运行,但这种写法在类型多的时候会很冗余。
更优雅高效的解决方案:用字典映射+向量化计算
我们可以先把street_typ和对应的系数做成一个字典,然后用map()方法快速匹配系数,再和cal_length相乘得到v_length:
# 第一步:定义类型与系数的映射字典,把你需要的类型和对应系数都加进来 coeff_mapping = { 'motorway': 130, 'motorway_link': 130, 'trunk': 120, # 这里替换成你实际的trunk系数 'primary': 110, # 示例:继续添加其他类型 'secondary': 90 } # 第二步:用map匹配系数,再乘以cal_length得到v_length street_cal['v_length'] = street_cal['street_typ'].map(coeff_mapping) * street_cal['cal_length']
处理未匹配到的类型
如果有些street_typ不在你的映射字典里,默认会得到NaN,如果你想给这些未匹配的类型设置默认系数(比如乘以1),可以用fillna():
street_cal['v_length'] = street_cal['street_typ'].map(coeff_mapping).fillna(1) * street_cal['cal_length']
为什么推荐这种写法?
- 效率更高:向量化操作是pandas底层优化过的,比逐行迭代快几十甚至上百倍,数据量越大越明显;
- 代码更简洁:不管有多少种
street_typ,只需要维护一个字典就行,可读性和可维护性都更强; - 更少出错:避免了循环里可能出现的索引错误或者重复赋值问题。
当然,如果你的类型很少,也可以保留loc的写法(但去掉多余的循环):
# 去掉循环后的写法,适合类型较少的场景 street_cal.loc[street_cal['street_typ'] == 'motorway', 'v_length'] = street_cal['cal_length'] * 130 street_cal.loc[street_cal['street_typ'] == 'motorway_link', 'v_length'] = street_cal['cal_length'] * 130 street_cal.loc[street_cal['street_typ'] == 'trunk', 'v_length'] = street_cal['cal_length'] * 120 # ...其他类型的赋值
内容的提问来源于stack exchange,提问作者Gabba
相关产品推荐
相关产品推荐

