Pandas DataFrame如何行转列 将metric_name各指标转为独立列
长表转指标宽表实现方法
你之前的代码逻辑是对metric_date分组后统计各metric_name的出现次数,所以返回结果全是1.0的计数值,无法得到value列的实际业务数值,用以下两种方法即可实现你要的宽表结构:
方法1:
pivot_table(优先推荐,兼容重复条目场景)
从你给出的指标计数来看,不同指标的记录条数存在差异,用pivot_table可以灵活处理重复值、缺失值问题,代码如下:# 行索引按需选择需要保留的公共维度字段 wide_data = data.pivot_table( index = ['metric_date', 'warehouse', 'week', 'year', 'day'], columns = 'metric_name', values = 'value', aggfunc = 'first' # 同维度同指标存在多条记录时的聚合规则,可按需替换为sum/mean等 ).reset_index() # 清理转置后残留的列名层级 wide_data.columns.name = None方法2:
pivot(仅适用于无重复维度组合场景)
如果你确认同一个公共维度+metric_name的组合不存在重复记录,可以直接用pivot实现,语法更简洁:wide_data = data.pivot( index = ['metric_date', 'warehouse', 'week', 'year', 'day'], columns = 'metric_name', values = 'value' ).reset_index() wide_data.columns.name = None
运行提示:如果使用pivot时报「存在重复索引条目」的错误,直接换回pivot_table方法,根据业务需求调整聚合规则即可。转换完成后的结果每一行对应唯一的日期+仓库等公共维度,每一列对应独立指标,单元格填充对应
value字段的数值,可直接用于时间序列预测建模。
内容的提问来源于stack exchange,提问作者Maxl Gemeinderat
相关产品推荐
相关产品推荐

