You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何使用Pandas整理ANOVA分析所需的目标格式表格?

问题

假设我有一个Pandas DataFrame df,数据如下:

column A  column B   column C
large     prom2      34
large     prom1      21
large     prom1      12
large     prom2      8
medium    prom2      5
medium    prom1      7
medium    prom1      12
medium    prom2      12
small     prom1      16
small     prom1      14
small     prom2      12
small     prom1      14

需要将其转换为适合方差分析(ANOVA)的格式:以column A的值作为第一列(命名为col_index),column B的内容作为新列(命名为col_prom1、col_prom2),column C的值填入对应位置,目标格式如下:

col_index  col_prom1  col_prom2
   large      21         34
   large      12         8
   medium     7          5
   medium     12         12
   small      16         12  
   small      14         NaN
   small      14         NaN

请问如何用Pandas实现这个转换?

解决方法

要实现这个格式转换,核心是给同分组下的条目添加组内序号来对齐prom1和prom2的行,再通过pivot重塑表格,具体操作如下:

步骤1:添加组内序号

给每个(column A, column B)的组合添加组内计数,让同分组下的第n条prom1和第n条prom2标记为同一个序号,确保后续行对齐:

df['group_id'] = df.groupby(['column A', 'column B']).cumcount()

步骤2:重塑表格

用pivot函数把column B的取值转成列,column C作为对应的值,同时用column A和group_id作为复合索引保证行的匹配:

pivoted_df = df.pivot(index=['column A', 'group_id'], columns='column B', values='column C').reset_index()

步骤3:调整格式匹配目标

重命名列名、删除多余的group_id列,最终得到目标格式:

# 重命名列
pivoted_df.columns = ['col_index', 'group_id', 'col_prom1', 'col_prom2']
# 删除不需要的group_id列
pivoted_df = pivoted_df.drop('group_id', axis=1)
# 重置行索引(可选,让行号从0开始)
pivoted_df = pivoted_df.reset_index(drop=True)

执行完上述代码后,pivoted_df就完全匹配需求格式:small分组下的3条prom1对应3行,其中只有第一行的col_prom2有值,其余两行自动填充NaN,完全适配方差分析的要求。


内容的提问来源于stack exchange,提问作者Dika

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.15 03:45:38