You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Pandas中按自定义分组提取每组首个元素?

解决方案

我们可以通过自定义分组规则,提取每个目标分组的首个元素,具体步骤如下:

1. 初始化数据

import pandas as pd

df = pd.DataFrame({'group': [1, 1, 2, 1, 1], 'value':['a','b','c','d','e']})

2. 构建自定义分组标识

先将value列的元素映射到指定分组类别,再通过判断类别变化生成连续的分组ID,确保a/b、c、d/e各自成为独立分组:

# 映射value到对应分组类别
value_group_map = {'a': 'ab_group', 'b': 'ab_group', 'c': 'c_group', 'd': 'de_group', 'e': 'de_group'}
df['temp_group'] = df['value'].map(value_group_map)

# 生成连续分组ID:当前行分组类别与上一行不同时,ID累加1
df['continuous_id'] = (df['temp_group'] != df['temp_group'].shift()).cumsum()

3. 提取每组首个元素

按生成的连续分组ID分组,取每组的第一个元素,最后保留需要的列:

result = df.groupby('continuous_id').first().reset_index(drop=True)[['group', 'value']]

验证结果

运行后result与预期一致:

print(result)
#    group value
# 0      1     a
# 1      2     c
# 2      1     d

如果想要更简洁的写法,可省去中间列的显式创建:

result = df.groupby(
    (df['value'].map({'a':'g1','b':'g1','c':'g2','d':'g3','e':'g3'}) != 
     df['value'].map({'a':'g1','b':'g1','c':'g2','d':'g3','e':'g3'}).shift()).cumsum()
).first().reset_index(drop=True)[['group', 'value']]

内容的提问来源于stack exchange,提问作者amha

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.20 20:54:16