R语言条件筛选年份列及CSV列重命名问题求助
问题解决与代码修正
原代码报错原因
最后一行括号嵌套错误,且年份提取逻辑有误——你直接对带X前缀的列名做数值比较,同时readr::parse_integer的参数位置错误,导致类型转换失败。
修正方案(无需修改原CSV列名)
所有处理都在读取数据后的内存中完成,不用改动原文件列名,以下两种方法均可实现需求:
方法1:用dplyr工具简洁实现
library(readr) library(dplyr) # 读取数据(保留原CSV列名) d <- read.csv("per_capita.csv") rc <- d[, -2:-3] df <- data.frame(rc) # 筛选印度数据 + 提取1994年之后的年份列 df %>% filter(Country.Name == "India") %>% select(Country.Name, matches("^X\\d{4}")) %>% # 匹配所有X+四位数字的年份列 select(Country.Name, where(~{ # 提取列名中的年份数字,筛选大于1994的列 year <- as.integer(sub("X", "", cur_column())) year > 1994 }))
方法2:修正原代码逻辑
如果你想沿用原代码思路,只需调整括号位置和年份提取逻辑:
df %>% filter(Country.Name == "India") %>% select( Country.Name, names(.)[-1][readr::parse_integer(sub("X", "", names(.)[-1])) > 1994] )
这里先通过sub("X", "", ...)去掉列名的X前缀,再转成整数做比较,同时修正了括号嵌套顺序。
关键说明
matches("^X\\d{4}")能精准匹配所有X开头+四位数字的年份列,避免误选其他列- 全程无需修改原CSV文件,所有列名处理仅在内存中进行
内容的提问来源于stack exchange,提问作者Ketan Mehta
相关产品推荐
相关产品推荐

