Pandas DataFrame行转列:将TipoPromo列取值转为对应列填充Desconto值
解决方案
你要实现的是长表转宽表的需求,使用pivot失败大概率是因为除TipoPromo、Desconto之外的其他列存在重复的分组键组合,你可以用以下两种方法实现:
方法1:使用pivot_table(推荐,适配存在重复分组的场景)
把除了TipoPromo、Desconto之外所有需要保留的非重复列作为index参数,TipoPromo作为columns参数,Desconto作为values参数,同时指定填充缺失值的规则即可:
import pandas as pd # 假设你的原DataFrame名为df # index中补充你所有需要保留的、原本存在重复的列,比如tickets等 df_wide = pd.pivot_table( df, index=['tickets', '其他需要保留的列1', '其他需要保留的列2'], columns='TipoPromo', values='Desconto', # 如果同一个分组下同一个TipoPromo有多个值,用sum聚合,也可以换成'mean'、'first'等符合业务逻辑的聚合方式 aggfunc='sum', fill_value=0 # 没有对应TipoPromo的行填充为0,也可以设为pd.NA ).reset_index() # 清除自动生成的列名前缀 df_wide.columns.name = None
方法2:使用groupby + unstack实现
如果更熟悉分组聚合的写法,也可以用下面的方式实现同样的效果:
df_wide = df.groupby(['tickets', '其他需要保留的列1', '其他需要保留的列2', 'TipoPromo'])['Desconto']\ .sum()\ .unstack(fill_value=0)\ .reset_index() df_wide.columns.name = None
补充说明
- 如果你确认同一个分组下不会出现同一个
TipoPromo对应多个Desconto值的情况,aggfunc可以替换为'first'直接取第一个值即可 - 如果需要给新生成的列统一加前缀,可以在重置列名后加
df_wide = df_wide.add_prefix('TipoPromo_')实现
内容的提问来源于stack exchange,提问作者Ysgramor 500
相关产品推荐
相关产品推荐

