You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言如何使用正则表达式筛选数据框符合条件的指定列

解决方案

你原本的反向筛选思路是可行的,问题出在正则表达式的语法错误,正则中没有&这种直接表示“同时包含”的写法,需要用正向先行断言实现同时匹配两个子串的逻辑。

可以直接使用如下代码实现需求:

df %>% select(!matches("^(?=.*age)(?=.*_)"))

代码说明

  • 正则^(?=.*age)(?=.*_)的匹配逻辑:
    • ^ 匹配字符串开头
    • (?=.*age) 是正向先行断言,代表字符串任意位置存在age子串
    • (?=.*_) 同理,代表字符串任意位置存在_子串
    • 两个断言叠加,就可以匹配所有**同时包含age和_**的列名
  • 前面加!表示反向选择,排除符合上述匹配规则的列,最终得到的就是你需要的三列:8.ageupwith65、9.agelo65、10.PM2_5

如果你更习惯正向匹配的写法,也可以直接筛选符合要求的列:

df %>% select(matches("^(?!.*age.*_)"))

这里的(?!.*age.*_)是否定先行断言,代表字符串中不存在“同时有age和_”的情况,效果和上面的反向筛选完全一致。

内容的提问来源于stack exchange,提问作者zhiwei li

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.25 15:36:03