Pandas如何查找DataFrame指定列含目标值的最近行补全分组缺失数据
实现方案
处理逻辑拆分:
- 先枚举每个分组下缺失的目标label值(规则要求每个group必须覆盖7、8、9三个label)
- 对每个缺失值,从现有数据中筛选同label的行,以分组日期为基准找时间距离最近的行作为补全模板
- 复制模板行,修改id为全局自增的新值、date替换为对应分组的日期、group替换为当前分组编号,追加到原表中
- 最后按分组、label排序得到最终结果
完整代码
import pandas as pd # 构造原始数据 df = pd.DataFrame( [ [1, 'aa', '02/05', 1, 7], [2, 'ba', '02/05', 1, 8], [3, 'cp', '09/05', 2, 7], [4, 'dd', '09/05', 2, 8], [5, 'ii', '09/05', 2, 9] ], columns=['id', 'info', 'date', 'group', 'label'] ) # 规则配置:每个分组必须包含的label值 required_labels = {7, 8, 9} # 预存每个分组对应的日期(适配同组日期唯一的场景) group_date_map = df.drop_duplicates('group').set_index('group')['date'].to_dict() # 日期转datetime格式,用于计算时间间距 df['date_dt'] = pd.to_datetime(df['date'], format='%d/%m') # 枚举所有缺失的(分组, label)组合 missing_pairs = [] for group_id, sub_df in df.groupby('group'): missing_labels = required_labels - set(sub_df['label'].unique()) for label in missing_labels: missing_pairs.append((group_id, label)) # 生成需要追加的补全行 append_list = [] new_id = df['id'].max() for group_id, miss_label in missing_pairs: base_date = pd.to_datetime(group_date_map[group_id], format='%d/%m') # 筛选同label的行,取和分组日期时间差最小的作为模板 template = df[df['label'] == miss_label].assign( day_gap = lambda x: abs((x['date_dt'] - base_date).dt.days) ).sort_values('day_gap').iloc[0].copy() # 更新补全行字段 new_id += 1 template['id'] = new_id template['group'] = group_id template['date'] = group_date_map[group_id] append_list.append(template.drop(['date_dt', 'day_gap'])) # 拼接数据并整理输出格式 result = pd.concat( [df.drop(columns='date_dt'), pd.DataFrame(append_list)], ignore_index=True ).sort_values(by=['group', 'label']).reset_index(drop=True)
结果验证
执行print(result)即可得到和预期完全一致的输出:
id info date group label 0 1 aa 02/05 1 7 1 2 ba 02/05 1 8 2 6 ii 02/05 1 9 3 3 cp 09/05 2 7 4 4 dd 09/05 2 8 5 5 ii 09/05 2 9
如果同组存在多个不同日期,只需要修改
group_date_map的取值逻辑、调整最近距离的计算规则即可适配。
内容的提问来源于stack exchange,提问作者Programmer14
相关产品推荐
相关产品推荐

