You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Microsoft.Spark .NET中GroupBy后对多列应用Agg聚合

实现方案

首先引入聚合函数依赖的命名空间:

using Microsoft.Spark.Sql;

.NET for Spark的Agg方法调用逻辑和PySpark完全对齐,聚合函数统一通过Functions静态类调用(对应PySpark里的func模块),直接在Agg参数中传入多个带别名的聚合表达式即可,和PySpark的写法逻辑一致。

你给出的示例对应的正确C#实现如下:

var newData = dataFrame
    .GroupBy("customer_id")
    .Agg(
        Functions.Mean("a").Alias("Mean"),
        Functions.StdDev("a").Alias("StDev")
    );

如果需要对多列做不同聚合,直接在Agg方法中追加对应聚合表达式即可,示例如下:

var multiAggDf = dataFrame
    .GroupBy("customer_id")
    .Agg(
        Functions.Mean("a").Alias("a_mean"),
        Functions.Max("b").Alias("b_max"),
        Functions.Sum("c").Alias("c_sum")
    );

你查询到的Agg(Column, Column[])方法签名本身就支持传入1个或多个列表达式,刚好匹配多聚合操作的需求,和PySpark的agg方法参数逻辑完全一致。

内容的提问来源于stack exchange,提问作者Wes Doyle

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.01 20:27:03