You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Polars中按cid1、cid2分组筛选cid3最大值行并保留全列?

Polars实现分组取最大值行并保留所有列的方法

针对你的需求,这里提供几种Polars的实现方式,对应你熟悉的Pandas思路,同时还有更高效的写法:

方法一:对应Pandas Transform思路(添加临时列后筛选)

Polars中用over子句实现类似Pandas transform的分组计算逻辑,直接给每行添加对应组的cid3最大值,再筛选匹配的行:

import polars as pl

# 给每行添加所在组的cid3最大值
df = df.with_columns(
    pl.col("cid3").max().over(["cid1", "cid2"]).alias("max_cid3")
)
# 筛选出cid3等于组内最大值的行,可选删除临时列
df = df.filter(pl.col("cid3") == pl.col("max_cid3")).drop("max_cid3")

方法二:窗口函数直接筛选(无需临时列)

更简洁的写法,直接在filter中用窗口函数判断当前行的cid3是否为组内最大值:

import polars as pl

df = df.filter(
    pl.col("cid3") == pl.col("cid3").max().over(["cid1", "cid2"])
)

方法三:排序后去重(适合无重复最大值场景)

如果每组的cid3最大值唯一,可以先按cid1、cid2升序,cid3降序排序,再保留每组的第一行:

import polars as pl

# 排序:cid1、cid2升序,cid3降序;然后按cid1、cid2去重,保留第一行(即cid3最大的行)
df = df.sort(
    ["cid1", "cid2", "cid3"],
    descending=[False, False, True]
).unique(["cid1", "cid2"], keep="first")

注意:如果组内存在多个cid3等于最大值的行,这种方法只会保留排序后的第一行,若需要保留所有最大值行,建议用前两种方法。

为什么你之前的代码无法保留其他列?

你之前用group_by+agg的方式属于聚合操作,会将每个分组的结果合并为一行,其他非聚合列会被打包成列表。而我们需要的是保留原始行结构,只筛选出符合条件的行,因此窗口函数(over子句)才是正确的选择——它会为每行计算对应分组的聚合值,而非改变行的数量。

内容的提问来源于stack exchange,提问作者Jahspear

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.07 18:45:33