合并含同名字段的两个数据集时如何将a.x、a.y合并为单个a列
解决方案
步骤1:完成两表基础合并
先按两表公共匹配字段id和date执行合并操作:
import pandas as pd # 构造示例表1 df1 = pd.DataFrame([ [1, '2020-01-01', 1], [2, '2020-01-02', 4], [3, '2020-01-04', 3], [4, '2020-01-25', None] ], columns=['id', 'date', 'a']) # 构造示例表2 df2 = pd.DataFrame([ [1, '2020-01-01', None, 0.1], [2, '2020-01-02', None, 0.2], [3, '2020-01-04', None, 0.3], [4, '2020-01-25', 5, 0.25] ], columns=['id', 'date', 'a', 'b']) # 按id、date匹配执行左连接 merge_df = pd.merge(df1, df2, on=['id', 'date'], how='left')
执行后得到的合并表中会出现a_x(来自表1的a列)、a_y(来自表2的a列)两个分列。
步骤2:合并a_x和a_y为单列a
由于两表a列有效值无重叠,同一行中a_x和a_y最多只有一个存在有效值,另一个为空值,可直接用空值填充逻辑完成合并:
# 方法1:优先取a_x的值,空值用a_y填充,逻辑最直观 merge_df['a'] = merge_df['a_x'].fillna(merge_df['a_y']) # 方法2:用combine_first实现,效果和方法1完全一致 # merge_df['a'] = merge_df['a_x'].combine_first(merge_df['a_y'])
步骤3:整理得到最终结果
筛选保留需要的字段即可:
result = merge_df[['id', 'date', 'a', 'b']] # 如果需要a列为整数类型,可额外执行类型转换:result['a'] = result['a'].astype(int) print(result)
输出结果和预期完全一致:
id date a b 0 1 2020-01-01 1.0 0.10 1 2 2020-01-02 4.0 0.20 2 3 2020-01-04 3.0 0.30 3 4 2020-01-25 5.0 0.25
内容的提问来源于stack exchange,提问作者Rya
相关产品推荐
相关产品推荐

