You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas groupby后执行cut和rank出现分组丢失问题求助

分组内整数密集分箱实现方案

核心错误原因:原代码仅对pd.cut执行了分组应用,后续的rank操作是全局执行,未保留分组约束,导致分箱排序逻辑跨组生效,结果不符合预期。所有分箱、排序操作都要放在分组apply的作用域内,才能保证分组逻辑不丢失。

正确实现代码如下:

import pandas as pd

groups = [1] * 8 + [2] * 8
values = [11,12,13,11,12,13,11,12, 21,22,23,24,25,26,27,28]
series = pd.Series(values, index=groups)

# 封装分组内分箱+排序逻辑
def bin_and_rank(group):
    cut_res = pd.cut(group, bins=4)
    rank_res = cut_res.rank(method="dense", ascending=True)
    return rank_res.astype(int)

# 全部分组执行上述逻辑
result = series.groupby(series.index).apply(bin_and_rank)

# 断言校验通过
assert list(result) == [1,2,3,1,2,3,1,2, 1,1,2,2,3,3,4,4]

如果偏好更简洁的写法,也可以用lambda表达式直接在apply中写逻辑,不需要额外定义函数:

result = series.groupby(series.index).apply(
    lambda g: pd.cut(g, bins=4).rank(method="dense").astype(int)
)

内容的提问来源于stack exchange,提问作者steve

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 20:45:04