You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

合并含同名字段的两个数据集时如何将a.x、a.y合并为单个a列

解决方案

步骤1:完成两表基础合并

先按两表公共匹配字段id和date执行合并操作:

import pandas as pd

# 构造示例表1
df1 = pd.DataFrame([
    [1, '2020-01-01', 1],
    [2, '2020-01-02', 4],
    [3, '2020-01-04', 3],
    [4, '2020-01-25', None]
], columns=['id', 'date', 'a'])

# 构造示例表2
df2 = pd.DataFrame([
    [1, '2020-01-01', None, 0.1],
    [2, '2020-01-02', None, 0.2],
    [3, '2020-01-04', None, 0.3],
    [4, '2020-01-25', 5, 0.25]
], columns=['id', 'date', 'a', 'b'])

# 按id、date匹配执行左连接
merge_df = pd.merge(df1, df2, on=['id', 'date'], how='left')

执行后得到的合并表中会出现a_x(来自表1的a列)、a_y(来自表2的a列)两个分列。

步骤2:合并a_x和a_y为单列a

由于两表a列有效值无重叠,同一行中a_x和a_y最多只有一个存在有效值,另一个为空值,可直接用空值填充逻辑完成合并:

# 方法1:优先取a_x的值,空值用a_y填充,逻辑最直观
merge_df['a'] = merge_df['a_x'].fillna(merge_df['a_y'])

# 方法2:用combine_first实现,效果和方法1完全一致
# merge_df['a'] = merge_df['a_x'].combine_first(merge_df['a_y'])

步骤3:整理得到最终结果

筛选保留需要的字段即可:

result = merge_df[['id', 'date', 'a', 'b']]
# 如果需要a列为整数类型,可额外执行类型转换:result['a'] = result['a'].astype(int)
print(result)

输出结果和预期完全一致:

id        date    a     b
0   1  2020-01-01  1.0  0.10
1   2  2020-01-02  4.0  0.20
2   3  2020-01-04  3.0  0.30
3   4  2020-01-25  5.0  0.25

内容的提问来源于stack exchange,提问作者Rya

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.06 21:00:02