如何在DataFrame中删除含不满足条件行的同组所有行?
解决方法:移除存在回答数量不足的整个分组
我来帮你搞定这个需求!核心思路是先找出所有存在至少一行回答数不达标的(Segment, Question, School)分组,然后直接把这些分组的所有数据从DataFrame中移除——不管组内其他行是否满足要求,只要组里有一行不达标,整组数据都剔除。
下面分两种常见情况给出具体实现:
情况1:所有分组的要求回答数是固定值(比如要求至少5个回答)
假设你的DataFrame名为df,包含Segment、Question、School、Answers列,我们可以用groupby.transform高效标记问题分组,再过滤:
import pandas as pd # 1. 定义要求的最小回答数 required_n = 5 # 2. 给每一行标记它所在的分组是否存在回答数不足的情况 df['has_insufficient'] = df.groupby(['Segment', 'Question', 'School'])['Answers'].transform( lambda x: (x < required_n).any() ) # 3. 过滤掉所有存在问题的分组 filtered_df = df[~df['has_insufficient']].drop('has_insufficient', axis=1)
代码解释:
groupby.transform会对每个分组计算是否有行满足Answers < required_n,然后把结果广播到分组内的每一行,这样每一行都能知道自己所在的组是否有问题。~df['has_insufficient']取反,保留那些没有任何回答数不足的分组的所有行。
情况2:不同分组有不同的要求回答数(DataFrame含Required列)
如果每个(Segment, Question, School)分组有自己的要求值(存在Required列),只需稍微调整逻辑,确保用当前分组的要求值判断:
import pandas as pd # 先确保数值类型正确(如果是字符串存储的话) df['Answers'] = pd.to_numeric(df['Answers'], errors='coerce') df['Required'] = pd.to_numeric(df['Required'], errors='coerce') # 标记问题分组 def check_group(group): # 假设同一个分组的Required值是一致的,取第一个值即可 group_required = group['Required'].iloc[0] return (group['Answers'] < group_required).any() # 给每个分组标记是否有问题,再广播到每一行 group_flags = df.groupby(['Segment', 'Question', 'School']).apply(check_group) df['has_insufficient'] = df.set_index(['Segment', 'Question', 'School']).index.map(group_flags) # 过滤数据 filtered_df = df[~df['has_insufficient']].drop('has_insufficient', axis=1)
注意点:
- 如果你的
Answers或Required是字符串格式,一定要先转成数值型,否则比较会出错。 - 确保同一个(Segment, Question, School)分组的
Required值是统一的,如果有不一致的情况,可能需要先清理数据。
这样处理后,filtered_df就是只保留了所有行都满足回答数要求的分组数据,完全符合你的需求!
内容的提问来源于stack exchange,提问作者Capper
相关产品推荐
相关产品推荐

