You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于Name字段填充Pandas数据集中缺失的ID值?

解决方法

你的问题核心是同一个Name对应唯一的ID,普通的ffill()会跨Name填充,导致错误。可以通过以下两种方式解决:

方法1:构建Name-ID映射字典填充

先提取每个Name对应的有效ID,再用这个映射批量填充缺失值:

import pandas as pd

# 读取/构造你的数据集(这里模拟原始数据)
df = pd.DataFrame({
    'ID': ['', '101', '', '101', '102', '102', '', '', '103'],
    'Name': ['Adam', 'Adam', 'Adam', 'Adam', 'Ben', 'Ben', 'Cathy', 'Cathy', 'Cathy']
})

# 将空字符串转为缺失值(如果你的原始数据是NaN可跳过这步)
df['ID'] = df['ID'].replace('', pd.NA)

# 生成Name到对应ID的映射(取每个Name下第一个非空ID)
id_map = df.dropna(subset=['ID']).groupby('Name')['ID'].first().to_dict()

# 填充缺失的ID
df['ID'] = df['Name'].map(id_map)

方法2:按Name分组后填充

利用分组操作,在每个Name的组内单独做向前/向后填充,避免跨Name污染:

import pandas as pd

# 读取/构造数据集
df = pd.DataFrame({
    'ID': ['', '101', '', '101', '102', '102', '', '', '103'],
    'Name': ['Adam', 'Adam', 'Adam', 'Adam', 'Ben', 'Ben', 'Cathy', 'Cathy', 'Cathy']
})

df['ID'] = df['ID'].replace('', pd.NA)

# 按Name分组后,组内向前填充缺失ID
df['ID'] = df.groupby('Name')['ID'].ffill()
# 也可以用向后填充,效果一致:df['ID'] = df.groupby('Name')['ID'].bfill()

两种方法处理后,都能得到你期望的结果。


内容的提问来源于stack exchange,提问作者Coding_Nubie

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.20 14:42:34