使用正则表达式筛选包含两个指定字符串的Pandas数据框列
解决Pandas数据框筛选含两个指定字符串列的问题
我明白你的需求啦——你想从Pandas数据框里筛选出列名同时包含DE、NL、FR中两个不同项的列,而不是只要包含其中一个就保留对吧?之前用df.filter(regex="DE|NL|FR")会把AT-DE这种只含一个目标字符串的列也选进来,确实不符合预期。这里有两个靠谱的解决方案:
方法一:使用正则表达式精准匹配
我们可以利用正则的正向预查功能,构造一个能同时检测到两个目标字符串的模式,确保列名里必须包含至少两个指定的代码:
# 构造正则模式:匹配同时包含任意两组目标字符串的列 pattern = r'(?=.*DE)(?=.*NL)|(?=.*DE)(?=.*FR)|(?=.*NL)(?=.*FR)' filtered_df = df.filter(regex=pattern)
正则说明:
(?=.*DE)是正向预查,确保字符串中存在DE(不管位置)- 用
|分隔三种组合:DE+NL、DE+FR、NL+FR,只要列名满足其中一种组合就会被选中
方法二:用列表推导式(更直观易读)
如果你的列名格式都是类似XX-YY这种两个代码用连字符分隔的形式,用列表推导式结合集合交集的方法会更清晰,也更容易维护:
# 定义目标字符串集合 target_codes = {'DE', 'NL', 'FR'} # 筛选列名分割后,与目标集合的交集长度为2的列 selected_columns = [ col for col in df.columns if len(target_codes.intersection(col.split('-'))) == 2 ] # 生成筛选后的数据框 filtered_df = df[selected_columns]
逻辑说明:
- 把每个列名按
-分割成两个部分 - 计算分割后的部分和目标集合的交集长度,如果等于2,说明这个列名包含两个不同的目标代码
- 最后用选中的列名子集生成新的数据框
这两种方法都能精准筛选出DE-NL、NL-DE、DE-FR这类符合要求的列,同时排除AT-DE这种仅含一个目标代码的列。
内容的提问来源于stack exchange,提问作者Denver Dang
相关产品推荐
相关产品推荐

