基于列信任优先级合并Pandas不同ID记录的实现方法
Pandas按列指定ID优先级合并记录解决方案
嘿,刚接触Pandas的话,这个按列指定优先级取值的需求其实不难实现,我给你一步步拆解:
首先,先把你给出的原始数据转换成可运行的Pandas DataFrame(直接复制就能用):
import pandas as pd # 你的原始数据 df1 = pd.DataFrame({ 'ID': [1], 'NAME': ['abc'], 'ADDRESS': ['street1'], 'PHONE': ['9999'] }) df2 = pd.DataFrame({ 'ID': [2], 'NAME': ['xyz'], 'ADDRESS': ['street2'], 'PHONE': ['8888'] }) # 列优先级规则表 df_col_priority = pd.DataFrame({ 'COLUMN': ['NAME', 'ADDRESS', 'PHONE'], 'PRIORITY_BY_ID': [1, 2, 2] })
接下来是核心逻辑:我们先把两个数据纵向合并,再根据优先级规则逐个提取对应ID的列值:
# 合并两个数据,用ID作为索引方便快速取值 combined_df = pd.concat([df1, df2]).set_index('ID') # 遍历优先级规则,构建最终结果字典 final_data = {} for _, rule in df_col_priority.iterrows(): col_name = rule['COLUMN'] target_id = rule['PRIORITY_BY_ID'] # 从合并表中取出对应ID和列的值 final_data[col_name] = combined_df.loc[target_id, col_name] # 转成DataFrame格式,就是你要的最终结果 result = pd.DataFrame([final_data]) print(result)
运行后输出的结果就是你期望的:
NAME ADDRESS PHONE 0 abc street2 8888
这个方法的好处是扩展性很强——哪怕以后你有更多ID的记录,或者更多列的优先级规则,只要修改原始数据和规则表,代码不用大改就能适配。
内容的提问来源于stack exchange,提问作者mukkira149
相关产品推荐
相关产品推荐

