You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何用部分匹配的字符串列表过滤DataFrame的long_name列?

解决方法

你遇到的问题主要有两个原因:一是代码里的变量名不匹配(squad_list应该是name_list),二是没有处理名字中的特殊字符导致正则匹配失效。下面给你两种可行的实现方式:

方法一:正则匹配(高效适合大数据量)

用re.escape对每个名字做转义,避免特殊字符(比如É)干扰正则匹配,同时用na=False直接排除空值行:

import pandas as pd
import re

name_list = ['LIONEL MESSI','CRISTIANO RONALD','KYLIAN MBAPPÉ']
df = pd.read_csv('你的CSV文件路径.csv')

# 转义每个名字后拼接成正则模式
match_pattern = '|'.join(re.escape(name) for name in name_list)
# 筛选符合条件的行
filtered_df = df[df['long_name'].str.contains(match_pattern, regex=True, na=False)]

方法二:遍历匹配(直观易读)

不用正则,直接遍历检查每个全名是否包含列表中的任意名字,适合数据量不大的场景:

import pandas as pd

name_list = ['LIONEL MESSI','CRISTIANO RONALD','KYLIAN MBAPPÉ']
df = pd.read_csv('你的CSV文件路径.csv')

# 用apply遍历每行,检查是否有匹配的名字
filtered_df = df[df['long_name'].apply(lambda x: any(name in str(x) for name in name_list))]

为什么之前的代码失效?

  1. 第二个代码里误用了squad_list变量,你的列表变量名是name_list,变量名不匹配会导致无结果或报错;
  2. 没有对名字中的特殊字符做转义,正则引擎可能无法正确识别MBAPPÉ里的É;
  3. 手动处理空值的方式繁琐,str.contains的na=False参数可以直接排除空值行。

内容的提问来源于stack exchange,提问作者ethanch0ng

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.08 11:40:44