按ID分组DataFrame后,如何检查字符串值对并设置Flag列?
解决方法
首先构造你的DataFrame:
import pandas as pd data = { 'ID': [1,1,1,2,2,3,4], 'Code': ['A','C','B','A','B','A','C'], 'Flag': [0,1,1,0,1,0,0] } df = pd.DataFrame(data)
步骤1:确定每个ID分组是否满足条件
我们需要先判断每个ID分组是否同时包含'A',且包含'B'或'C'。通过groupby结合apply生成一个ID到布尔值的映射:
# 生成每个ID是否符合条件的字典 id_qualifies = df.groupby('ID')['Code'].apply( lambda codes: 'A' in set(codes) and (('B' in set(codes)) or ('C' in set(codes))) ).to_dict()
步骤2:更新Flag列
根据上面的映射,将符合条件的ID对应的所有行的Flag设为1,其余行保持原Flag值:
df['Flag'] = df.apply(lambda row: 1 if id_qualifies[row['ID']] else row['Flag'], axis=1)
最终结果
处理后的DataFrame如下:
| ID | Code | Flag |
|---|---|---|
| 1 | A | 1 |
| 1 | C | 1 |
| 1 | B | 1 |
| 2 | A | 1 |
| 2 | B | 1 |
| 3 | A | 0 |
| 4 | C | 0 |
为什么filter()没达到预期?
groupby.filter()的作用是筛选出符合条件的分组行,而不是修改原数据的列值。它会返回一个新的DataFrame,只包含满足条件的分组,但无法直接更新原DataFrame中对应行的Flag字段。如果要修改字段值,需要先确定哪些ID分组符合条件,再批量更新对应行,这就是上面方案的核心逻辑。
内容的提问来源于stack exchange,提问作者Alpha Beta
相关产品推荐
相关产品推荐

