You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python合并多份DataFrame并按年度选取最大val值

合并DataFrame并按年度保留最大val值的实现方法

核心思路

将两个DataFrame合并后,按CY年度分组,提取每组中val值最大的行,即可覆盖所有出现的年份,同时自动保留同年度最大的val及对应的frame数据。

代码实现

假设你的两个DataFrame分别为df1和df2,结构包含CY(年度)、val、frame三列:

import pandas as pd

# 合并两个DataFrame,重置索引避免重复
combined_df = pd.concat([df1, df2], ignore_index=True)

# 按年度分组,提取每组中val最大的行
result_df = combined_df.loc[combined_df.groupby('CY')['val'].idxmax()]

# 可选:重置结果的索引
result_df = result_df.reset_index(drop=True)

关键步骤说明

  • pd.concat([df1, df2], ignore_index=True):将两个表纵向拼接,ignore_index=True重新生成连续索引,避免原表索引冲突。
  • combined_df.groupby('CY')['val'].idxmax():按CY分组后,定位每个组内val值最大的行的索引位置。
  • loc[...]:根据索引提取对应行,最终得到每个年度仅保留最大val及对应frame数据的结果。

特殊情况处理

如果同一年度存在多个行的val值同为最大值,idxmax()会返回该组中第一个出现的最大val所在行。若需要保留所有最大val的行,可改用以下代码:

# 计算每个年度的最大val值
max_vals = combined_df.groupby('CY')['val'].max().reset_index(name='max_val')

# 筛选出val等于对应年度max_val的行
result_df = pd.merge(combined_df, max_vals, on='CY')
result_df = result_df[result_df['val'] == result_df['max_val']].drop(columns='max_val')

内容的提问来源于stack exchange,提问作者user14708750

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.13 22:13:18