如何从Pandas DataFrame列中匹配城市列表提取对应地点值
问题原因
你的原有代码存在两个核心问题:
- 每次触发匹配逻辑时,都是对整个
Localidad列统一赋值,而非给当前匹配到的单行赋值,因此所有行的取值最终都会被最后一次赋值的内容覆盖。 - 你直接将完整的
desc文本赋值给了目标列,没有单独提取匹配到的城市名称。
另外补充一个语法小问题:你定义城市列表时Corrientes前缺少单引号,且不要用list作为变量名,list是Python内置关键字,容易引发命名冲突。
解决方案
推荐使用pandas向量化字符串操作实现需求,性能远高于手动循环,代码也更简洁:
import pandas as pd import re # 原始DataFrame定义 obras = pd.DataFrame([ ['1','Agua de Buenos Aires'], ['2', 'Sistenas de carreteras Jujuy'], ['3','Reasentamiento en Entre Ríos'], ['4','Rutas en Córdoba'] ], columns = ['id', 'desc']) # 修正后的城市列表,避免用list作为变量名 city_list = ['Buenos Aires', 'Jujuy', 'Corrientes', 'Entre Ríos'] # 构建正则匹配模式:按城市名称长度倒序排列,避免短名称被优先匹配的问题 pattern = '|'.join(sorted(map(re.escape, city_list), key=len, reverse=True)) # 提取匹配到的城市到新列,未匹配到的自动为NaN obras['Localidad'] = obras['desc'].str.extract(f'({pattern})', expand=False)
运行后obras的结果
| id | desc | Localidad |
|---|---|---|
| 1 | Agua de Buenos Aires | Buenos Aires |
| 2 | Sistenas de carreteras Jujuy | Jujuy |
| 3 | Reasentamiento en Entre Ríos | Entre Ríos |
| 4 | Rutas en Córdoba | NaN |
如果你更习惯用循环实现,可参考修正后的循环写法:
# 先初始化列全为缺失值 obras['Localidad'] = pd.NA # 遍历每行的索引和desc内容 for idx, desc_text in obras['desc'].items(): for city in city_list: if city in desc_text: # 仅给当前匹配到的行赋值 obras.loc[idx, 'Localidad'] = city # 匹配到第一个城市后跳出循环,避免多个城市匹配的冲突 break
内容的提问来源于stack exchange,提问作者Facundo Javier Vargas
相关产品推荐
相关产品推荐

