Pandas按loc10p分组后将subgrupoloc10转为全局连续编号的问题
解决方案
直接使用pandas内置的groupby.ngroup()方法即可完成需求,无需手动循环拆分DataFrame:
# 先按loc10p、subgrupoloc10升序排列,保证全局编号顺序符合预期 c2 = c2.sort_values(['loc10p', 'subgrupoloc10']).reset_index(drop=True) # 按两个字段联合分组生成全局唯一编号,默认从0开始,加1后符合从1计数的规则 c2['subgrupoloc10'] = c2.groupby(['loc10p', 'subgrupoloc10'], sort=False).ngroup() + 1
结果验证
执行完上述代码后输出指定数据,可得到期望的结果:
print(c2[c2.loc10p.isin([1,2])][['loc10p','subgrupoloc10']])
原代码问题说明
之前的写法存在两个核心问题:
- 循环逻辑是给每个loc10p大组的所有行设置同一个编号,没有区分大组下的不同subgrupoloc10子组
- 从原df中筛选出来的temp是切片对象,直接修改不会生效,还会触发
SettingWithCopyWarning告警
内容的提问来源于stack exchange,提问作者Arnoldo Oliva
相关产品推荐
相关产品推荐

