如何将DataFrame横向重构,避免ProblemGroup列重复?
实现DataFrame横向排列(长表转宽表)
原始数据示例
先构造对应结构的DataFrame:
import pandas as pd df = pd.DataFrame({ 'ProblemGroup': ['A', 'A', 'B', 'B'], 'month': [1, 2, 1, 2], 'Count': [362, 485, 400, 487] })
原始表格结构:
| ProblemGroup | month | Count |
|---|---|---|
| A | 1 | 362 |
| A | 2 | 485 |
| B | 1 | 400 |
| B | 2 | 487 |
方法1:使用pivot函数
针对无重复(month, ProblemGroup)组合的数据,直接用pivot转换:
pivoted_df = df.pivot(index='month', columns='ProblemGroup', values='Count').reset_index() # 移除列名的层级标签,让表格结构更简洁 pivoted_df.columns.name = None
转换后结果:
| month | A | B |
|---|---|---|
| 1 | 362 | 400 |
| 2 | 485 | 487 |
方法2:使用pivot_table函数
如果数据存在重复的(month, ProblemGroup)组合,pivot_table可通过聚合函数处理,这里用sum适配当前场景:
pivot_table_df = df.pivot_table( index='month', columns='ProblemGroup', values='Count', aggfunc='sum' ).reset_index() pivot_table_df.columns.name = None
得到的结果与方法1完全一致。
关键参数说明
index:指定作为行标识的字段(此处为month)columns:指定转换为列名的字段(此处为ProblemGroup,其唯一值会成为新列名)values:指定填充到单元格的数值字段(此处为Count)reset_index():将行索引转为普通列,匹配期望的表格结构columns.name = None:清除列名的层级标记,优化表格展示效果
内容的提问来源于stack exchange,提问作者Rodrigo Fernandes
相关产品推荐
相关产品推荐

