如何在R语言中基于关键词列表实现正则匹配过滤字符向量?
基于关键词过滤字符向量的方法
你要实现的是检测list1中的每个字符串是否包含fruit里的任意关键词(不区分大小写),最终返回逻辑向量c(TRUE, FALSE, TRUE),以下是几种可行方案:
方法一:使用stringr包(推荐)
借助stringr的str_detect()函数检测字符串匹配,结合str_c()将关键词合并为正则模式,同时开启忽略大小写选项:
library(stringr) list1 <- c("I like apples", "I eat bread", "Bananas are my favorite") fruit <- c("apple","banana") # 合并关键词为正则匹配模式,支持忽略大小写 pattern <- str_c(fruit, collapse = "|") result <- str_detect(list1, regex(pattern, ignore_case = TRUE)) result # 输出结果:TRUE FALSE TRUE
方法二:基础R原生实现
不用额外安装包,用grepl()函数结合正则表达式即可完成需求:
list1 <- c("I like apples", "I eat bread", "Bananas are my favorite") fruit <- c("apple","banana") # 拼接关键词为正则模式 pattern <- paste0(fruit, collapse = "|") result <- grepl(pattern, list1, ignore.case = TRUE) result # 输出结果:TRUE FALSE TRUE
方法三:使用stringi包
stringi作为字符串处理的底层包,同样可以快速实现该功能:
library(stringi) list1 <- c("I like apples", "I eat bread", "Bananas are my favorite") fruit <- c("apple","banana") pattern <- stri_c(fruit, collapse = "|") result <- stri_detect_regex(list1, pattern, case_insensitive = TRUE) result # 输出结果:TRUE FALSE TRUE
内容的提问来源于stack exchange,提问作者timnus
相关产品推荐
相关产品推荐

