You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用Python从两个DataFrame中筛选最邻近的坐标点?

从DataFrame中匹配最邻近坐标点的Python实现

先清理重复数据

原数据存在大量重复的时间戳与坐标,先去重可大幅降低后续计算成本:

# 按time_local、Lat、Long字段去重,保留每组第一条数据
df1_unique = df1.drop_duplicates(subset=['time_local', 'Lat', 'Long'], keep='first')
df2_unique = df2.drop_duplicates(subset=['time_local', 'Lat', 'Long'], keep='first')

两种实现方案

方案1:欧氏距离快速匹配(适用于平面坐标场景)

使用scikit-learn的NearestNeighbors模块实现高效最近邻搜索:

from sklearn.neighbors import NearestNeighbors
import numpy as np

# 提取df1的坐标特征矩阵
coord_df1 = df1_unique[['Lat', 'Long']].values
# 初始化最近邻模型,设定仅查找1个最近邻
nn_model = NearestNeighbors(n_neighbors=1, algorithm='auto').fit(coord_df1)
# 对df2的每个坐标点计算最近邻的距离与对应索引
distances, match_indices = nn_model.kneighbors(df2_unique[['Lat', 'Long']].values)

# 将匹配结果合并到df2
df2_matched = df2_unique.reset_index(drop=True)
# 从去重后的df1中取出匹配到的行,添加前缀区分
matched_df1_rows = df1_unique.iloc[match_indices.flatten()].reset_index(drop=True).add_prefix('matched_')
# 合并数据
final_result = df2_matched.join(matched_df1_rows)

方案2:球面距离精准匹配(适用于GPS经纬度场景)

如果是真实地理经纬度,用geopandas的空间连接方法计算球面距离,结果更准确:

import geopandas as gpd

# 将普通DataFrame转换为GeoDataFrame,指定坐标系为WGS84(GPS常用)
gdf1 = gpd.GeoDataFrame(
    df1_unique,
    geometry=gpd.points_from_xy(df1_unique.Long, df1_unique.Lat),
    crs="EPSG:4326"
)

gdf2 = gpd.GeoDataFrame(
    df2_unique,
    geometry=gpd.points_from_xy(df2_unique.Long, df2_unique.Lat),
    crs="EPSG:4326"
)

# 执行最近邻空间连接,max_distance可选,用于过滤过远的匹配点
final_result = gpd.sjoin_nearest(
    gdf2, gdf1, 
    how='left', 
    max_distance=0.001,  # 单位为度,约对应110米左右
    lsuffix='_df2', 
    rsuffix='_df1'
)

额外提示

  • 若需限定时间范围匹配(如仅找同一时间戳或相近时间的最近点),可先按time_local字段分组,再在每组内执行上述匹配逻辑;
  • 去重步骤可根据实际需求跳过,但会增加计算耗时。

内容的提问来源于stack exchange,提问作者matrix_season

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.14 03:01:07