如何在pandas多级索引DataFrame中基于分组最大值新增指定列
解决方案
生成Step2列
你可以用groupby搭配transform方法实现需求,transform会将分组后的聚合结果广播到组内所有行,返回的结果长度和原DataFrame完全一致,可以直接赋值为新列:
# 按索引级Hour分组,对Step1求最大值后广播到组内所有行 df['Step2'] = df.groupby(level='Hour')['Step1'].transform('max')
如果你的多级索引没有显式命名,也可以用索引序号指定分组级别:
df['Step2'] = df.groupby(level=0)['Step1'].transform('max')
生成Step3列
基于已经生成的Step2列,用where做条件筛选即可:仅当Level索引值为Level_0时保留最大值,其余行默认填充NaN(即不展示值)
# 提取Level索引的值做判断 df['Step3'] = df['Step2'].where(df.index.get_level_values('Level') == 'Level_0')
如果不想依赖Step2列,也可以直接写为一行:
df['Step3'] = df.groupby(level='Hour')['Step1'].transform('max').where(df.index.get_level_values('Level') == 'Level_0')
内容的提问来源于stack exchange,提问作者hbstha123
相关产品推荐
相关产品推荐

