You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

pandas groupby选取指定多列后执行apply操作失败如何解决?

问题解答

核心错误原因

你定义的函数f仅支持分组后传入单列(Series类型)的场景:

  • 执行df.groupby('A')['C']时,传入f的每个分组是仅包含C列的Series,直接作为值传入字典构建DataFrame符合结构要求,因此可以正常运行
  • 调整为df.groupby('A')[['C', 'D']]后,传入f的每个分组是同时包含C、D两列的DataFrame,此时直接把多列的DataFrame赋值给original单个字段,会出现维度不匹配的问题,因此执行报错。

修复方案

方案1:修改函数适配多列输入

如果需要对C、D两列分别生成原始值、去均值结果,可以修改函数如下:

def f(group):
    res = pd.DataFrame()
    # 遍历分组内的每一列分别计算
    for col in group.columns:
        res[f"{col}_original"] = group[col]
        res[f"{col}_demeaned"] = group[col] - group[col].mean()
    return res

grouped.apply(f)

方案2:使用更简洁的多级列名实现

如果希望用更简洁的写法,同时保留列名的层级关系,可以用以下代码:

grouped.apply(
    lambda x: pd.concat(
        [x, x - x.mean()], 
        axis=1, 
        keys=["original", "demeaned"]
    )
)

返回结果的列会是二级索引,第一层为original/demeaned,第二层为原列名C/D,结构更清晰易读。


内容的提问来源于stack exchange,提问作者PTQuoc

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.24 18:15:07