使用R提取.edu后缀网站关联人名 代码返回NA如何解决
问题原因
你编写的代码核心错误为行索引逻辑错误:str_sub(merged_data$Website, -3, -1) 会返回每个网站地址最后三位的字符串,直接将该字符串向量作为数据集的行索引时,R会尝试将字符串与数据集的行名做匹配,无法匹配到对应行就会全部返回NA值。
修改方案
如果需要筛选后缀为.edu的网站对应的人员信息,需要先生成布尔逻辑向量作为行索引,修改后的代码如下:
library(stringr) # 提取网址最后三位转小写后判断是否为edu,兼容大写.EDU、网址首尾带空格的场景 edu_filter <- str_to_lower(str_trim(merged_data$Website)) |> str_sub(-3, -1) == "edu" # 用布尔向量筛选符合条件的行 educational_institution = merged_data[edu_filter, c('LastName', 'FirstName','Website')] head(educational_institution)
如果你需要匹配的是包含.edu的所有网址(比如.edu.cn、.edu.hk这类非最后三位的.edu后缀),可以改用正则匹配的方式:
library(stringr) # 匹配所有包含.edu的网址 edu_filter <- str_detect(str_to_lower(str_trim(merged_data$Website)), "\\.edu") educational_institution = merged_data[edu_filter, c('LastName', 'FirstName','Website')] head(educational_institution)
内容的提问来源于stack exchange,提问作者tsy1
相关产品推荐
相关产品推荐

