You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何合并仅部分列名匹配且列值部分匹配的两个DataFrame?

解决方案:合并DataFrame并保留指定State/City组合

嘿,你的需求其实完全可以用你提到的merge()或者inner_join()来实现,只是可能没用到正确的参数组合~ 核心逻辑是:以State和City作为联合匹配键,只保留两个表中都存在的组合(也就是内连接,刚好符合你要保留df1所有条目、过滤df2中无关条目的要求),同时把df2的贫困数据列合并过来。

方法一:使用Pandas的merge()

先构造示例数据(方便你直接测试),然后执行内连接:

import pandas as pd

# 构造你的df1
df1 = pd.DataFrame({
    'State': ['CA', 'CA', 'NY', 'ID'],
    'City': ['SF', 'Fresno', 'Ithaca', 'Boise'],
    'Votes2007': [17000, 16500, 12100, 17200]
})

# 构造你的df2
df2 = pd.DataFrame({
    'State': ['CA', 'OR', 'NY', 'NY', 'CA', 'ID'],
    'City': ['SF', 'Bend', 'Ithaca', 'Montauk', 'Fresno', 'Boise'],
    'Pov2009': [.1, .05, .02, .03, .15, .04],
    'Pov2010': [.15, .05, .04, .02, .12, .04]
})

# 执行内连接,指定联合匹配键
df3 = pd.merge(df1, df2, on=['State', 'City'], how='inner')

print(df3)

运行后得到的df3就是你预期的结果:

State    City  Votes2007  Pov2009  Pov2010
0    CA      SF      17000     0.10     0.15
1    CA  Fresno      16500     0.15     0.12
2    NY  Ithaca      12100     0.02     0.04
3    ID    Boise      17200     0.04     0.04

补充:Pandas的merge()默认how='inner',所以其实可以省略这个参数,直接写pd.merge(df1, df2, on=['State', 'City'])也能得到一样的结果。

方法二:使用R的dplyr包inner_join()

如果你用R语言,同样用内连接就能解决问题:

library(dplyr)

# 构造df1
df1 <- data.frame(
  State = c("CA", "CA", "NY", "ID"),
  City = c("SF", "Fresno", "Ithaca", "Boise"),
  Votes2007 = c(17000, 16500, 12100, 17200)
)

# 构造df2
df2 <- data.frame(
  State = c("CA", "OR", "NY", "NY", "CA", "ID"),
  City = c("SF", "Bend", "Ithaca", "Montauk", "Fresno", "Boise"),
  Pov2009 = c(.1, .05, .02, .03, .15, .04),
  Pov2010 = c(.15, .05, .04, .02, .12, .04)
)

# 执行内连接,指定联合匹配键
df3 <- inner_join(df1, df2, by = c("State", "City"))

print(df3)

运行后输出的结果和你预期的df3完全一致,inner_join()默认只保留两个表中都存在的匹配项,完美符合你的需求。

内容的提问来源于stack exchange,提问作者Emma

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.13 08:37:03