You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas优化实现:高效将DataFrame指定列按年份与另一DataFrame对应年份值相除

Pandas优化实现:高效将DataFrame指定列按年份与另一DataFrame对应年份值相除

嘿,我完全懂你不想用循环的心情——Pandas本来就提供了好多原生方法来处理这种按组匹配计算的需求,咱们直接把循环换掉,用更简洁高效的方式实现!

先明确下需求:我们要把df1里的数值列(B、C),按year分组,每组的所有值除以df2中对应年份的同列数值,同时保留非数值列(比如D列)的内容。


方案一:用Merge+广播实现(最直观易读)

这个思路是先把两个DataFrame按year左连接,让df1的每一行都带上df2对应年份的参照值,然后直接做除法运算,最后整理列结构就行,完全不用循环:

import pandas as pd

# 原始数据
df1 = pd.DataFrame({
    'year': [1, 1, 0, 0],
    'B': [4, 2, 1, 5],
    'C': [5, 3, 2, 6],
    'D': ["Good 1", "Good 2", "Good 1", "Good 2"]
})
df2 = pd.DataFrame({'year': [1, 0], 'B': [3, 5], 'C': [4, 7]})

vars_to_replace = ['B', 'C']

# 1. 按year左连接两个DataFrame,给df2的列加后缀区分
merged = df1.merge(df2, on='year', suffixes=('', '_ref'))

# 2. 对目标列执行除法
for col in vars_to_replace:
    merged[col] = merged[col] / merged[f'{col}_ref']

# 3. 删掉参照列,得到最终结果
result = merged.drop([f'{col}_ref' for col in vars_to_replace], axis=1)
print(result)

运行结果和你原来的循环方法完全一致:

year         B         C       D
0     1  1.333333  1.250000  Good 1
1     1  0.666667  0.750000  Good 2
2     0  0.200000  0.285714  Good 1
3     0  1.000000  0.857143  Good 2

方案二:用Map映射(更高效,适合大数据量)

如果你的数据量很大,merge可能会有额外的内存开销,这时候可以把df2转成以year为键的字典,用map快速匹配参照值,再做除法:

import pandas as pd

# 原始数据
df1 = pd.DataFrame({
    'year': [1, 1, 0, 0],
    'B': [4, 2, 1, 5],
    'C': [5, 3, 2, 6],
    'D': ["Good 1", "Good 2", "Good 1", "Good 2"]
})
df2 = pd.DataFrame({'year': [1, 0], 'B': [3, 5], 'C': [4, 7]})

vars_to_replace = ['B', 'C']

# 把df2转成以year为索引的DataFrame
df2_indexed = df2.set_index('year')

# 对每个目标列,用year映射得到参照值,再相除
for col in vars_to_replace:
    df1[col] = df1[col] / df1['year'].map(df2_indexed[col])

print(df1)

这个方法直接在原df1上修改(或者你可以复制一份再操作),避免了merge带来的中间DataFrame,内存效率更高,结果和之前完全一样。


为什么你之前的Set_Index方法会报错?

你之前尝试的set_index后直接相除,会报ValueError: cannot reindex on an axis with duplicate labels,原因是:
当df1设置year为索引后,索引存在重复值(比如year=1出现两次),而df2的索引是唯一的。Pandas在做除法时会尝试按索引对齐,但重复索引无法和唯一索引正确广播,所以触发了错误。而上面的两种方法都避开了这个问题,要么通过merge把参照值广播到每一行,要么通过map直接给每一行匹配对应的值。


总结

  • 如果你追求代码可读性,选Merge方案,逻辑清晰,不容易出错;
  • 如果处理大数据集,选Map映射方案,内存占用更低,运算更快。

两种方案都完美替代了循环,完全符合Pandas的“向量化运算”风格!

备注:内容来源于stack exchange,提问作者Leksa99

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.14 10:49:37