You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python/Pandas自连接DataFrame获取上一年度数据?

实现Pandas DataFrame补充上一年度财务数据

方法一:自连接(严格匹配上一年)

这是完全符合你需求的方案,通过创建辅助表并左连接,严格匹配同一客户(AcctID+Cntry)下Year = 当前Year - 1的记录。

步骤:

  1. 复制原DataFrame,将Year字段加1,并重命名财务字段为带Prev前缀的名称;
  2. 将原DataFrame与辅助表按AcctID、Cntry、Year做左连接,保留原表所有记录,无匹配则填充NaN(对应预期的null)。

代码示例:

import pandas as pd

# 假设你的原DataFrame为fin_df
# 1. 创建辅助表
prev_fin_df = fin_df.copy()
# 将Year加1,作为匹配原表Year的连接键
prev_fin_df['Year'] = prev_fin_df['Year'] + 1
# 重命名财务字段
prev_fin_df = prev_fin_df.rename(columns={
    'Revenue': 'PrevRevenue',
    'Income': 'PrevIncome'
})

# 2. 左连接原表与辅助表
result_df = pd.merge(
    fin_df,
    prev_fin_df,
    on=['AcctID', 'Cntry', 'Year'],
    how='left'
)

# 输出结果(与预期一致)
print(result_df)

说明:

  • 辅助表的Year设置为原年份+1,确保原表每条记录能精准匹配到同客户下的上一年数据;
  • 左连接会保留原表所有行,没有对应上一年数据的记录,PrevRevenue和PrevIncome自动填充NaN,符合你的规则要求。

方法二:分组后Shift(仅适用于年份连续场景)

如果你的数据中每个客户的年份是连续无断层的,可以用groupby+shift简化操作,但如果存在年份缺失(比如A5001 USA无2013年数据),此方法会错误填充前一条记录的数据,不符合你的需求,仅作参考:

代码示例:

# 先按客户和年份排序,确保顺序正确
sorted_df = fin_df.sort_values(['AcctID', 'Cntry', 'Year'])
# 按客户分组,将财务字段下移一行(取分组内的前一条记录)
sorted_df[['PrevRevenue', 'PrevIncome']] = sorted_df.groupby(['AcctID', 'Cntry'])[['Revenue', 'Income']].shift(1)

内容的提问来源于stack exchange,提问作者Ryan_Accountant

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.26 03:13:23