pandas如何遍历原有列应用函数批量生成百分比计算新列?
实现方案
正确代码
import pandas as pd import numpy as np # 可选,用于处理除零异常场景 # 提前计算所有列共用的分母,避免重复计算提升运行效率 denominator = df['A'] * df['B'] # 遍历跳过前2列的所有待计算列 for col in df.columns[2:]: new_col_name = f'perc_{col}' # 直接使用pandas向量化运算计算新列,性能远高于逐行/逐列调用apply df[new_col_name] = (df[col] / denominator) * 100 # 可选优化:如果A/B列存在0值会生成无穷大结果,可统一替换为NaN # df[new_col_name] = (df[col] / denominator).replace([np.inf, -np.inf], np.nan) * 100
原代码报错原因
- 第一次写法错误:
apply传入函数的参数是列的数值序列而非列名,同时未对perc_x做字符串格式化,直接把变量名当成了列名的一部分,触发KeyError - 第二次写法错误:直接把列名字符串当成数值参与算术运算,同时访问了不存在的复合索引
df[column, new_column],触发类型错误和索引错误
内容的提问来源于stack exchange,提问作者Lucia Iezzi
相关产品推荐
相关产品推荐

