You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何从Pandas DataFrame列中匹配城市列表提取对应地点值

问题原因

你的原有代码存在两个核心问题:

  1. 每次触发匹配逻辑时,都是对整个Localidad列统一赋值,而非给当前匹配到的单行赋值,因此所有行的取值最终都会被最后一次赋值的内容覆盖。
  2. 你直接将完整的desc文本赋值给了目标列,没有单独提取匹配到的城市名称。

另外补充一个语法小问题:你定义城市列表时Corrientes前缺少单引号,且不要用list作为变量名,list是Python内置关键字,容易引发命名冲突。

解决方案

推荐使用pandas向量化字符串操作实现需求,性能远高于手动循环,代码也更简洁:

import pandas as pd
import re

# 原始DataFrame定义
obras = pd.DataFrame([
    ['1','Agua de Buenos Aires'],
    ['2', 'Sistenas de carreteras Jujuy'],
    ['3','Reasentamiento en Entre Ríos'], 
    ['4','Rutas en Córdoba']
], columns = ['id', 'desc'])

# 修正后的城市列表,避免用list作为变量名
city_list = ['Buenos Aires', 'Jujuy', 'Corrientes', 'Entre Ríos']

# 构建正则匹配模式:按城市名称长度倒序排列,避免短名称被优先匹配的问题
pattern = '|'.join(sorted(map(re.escape, city_list), key=len, reverse=True))

# 提取匹配到的城市到新列,未匹配到的自动为NaN
obras['Localidad'] = obras['desc'].str.extract(f'({pattern})', expand=False)

运行后obras的结果

iddescLocalidad
1Agua de Buenos AiresBuenos Aires
2Sistenas de carreteras JujuyJujuy
3Reasentamiento en Entre RíosEntre Ríos
4Rutas en CórdobaNaN

如果你更习惯用循环实现,可参考修正后的循环写法:

# 先初始化列全为缺失值
obras['Localidad'] = pd.NA

# 遍历每行的索引和desc内容
for idx, desc_text in obras['desc'].items():
    for city in city_list:
        if city in desc_text:
            # 仅给当前匹配到的行赋值
            obras.loc[idx, 'Localidad'] = city
            # 匹配到第一个城市后跳出循环,避免多个城市匹配的冲突
            break

内容的提问来源于stack exchange,提问作者Facundo Javier Vargas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 13:54:05