如何在Pandas中基于现有列映射生成两列新数据并追踪更新
解决方案
先把嵌套的update_values转换成两个扁平字典,分别对应新列的映射关系,这样后续生成新列会更高效:
# 构建Column_1到名字的映射 name_map = {} # 构建Column_1到分组的映射 group_map = {} for group, items in update_values.items(): for col1_val, name in items.items(): name_map[col1_val] = name group_map[col1_val] = group
接着用Pandas的map()方法直接生成两个新列,比多次调用replace()更简洁:
import pandas as pd # 假设你的原数据表是df df['Column_new_2'] = df['Column_1'].map(name_map) df['Column_new_3'] = df['Column_1'].map(group_map)
验证更新是否完成
可以通过两种方式确认新列生成结果:
- 检查新列是否存在缺失值(如果原
Column_1的所有值都在update_values里,应该没有NaN):print(df[['Column_new_2', 'Column_new_3']].isna().sum()) - 直接输出目标列对比格式:
print(df[['Column_1', 'Column_new_2', 'Column_new_3']])
这种方法一次构建映射、批量生成新列,后续如果要新增分组或修改映射,只需要调整update_values即可,逻辑维护起来更省心。
内容的提问来源于stack exchange,提问作者pinq-
相关产品推荐
相关产品推荐

