使用fread导入数据后如何在R中筛选geo_coord字符列去除空值
解决方案
你已经用data.table导入了数据集,优先推荐用原生语法操作,性能远高于dplyr,尤其你导入的是百万行级数据:
情况1:空单元格读取后为NA
直接用is.na()判断即可:
dt_filtered <- dt[!is.na(geo_coord)]
情况2:空单元格读取后为空字符串""
这是你之前用dplyr的filter未生效的最常见原因:大部分tsv文件的空单元格默认会被fread识别为空字符串,而非NA值,仅过滤NA当然没有效果:
dt_filtered <- dt[geo_coord != ""]
情况3:同时存在NA和空字符串
合并两个判断条件即可:
dt_filtered <- dt[!is.na(geo_coord) & geo_coord != ""]
如果你需要用dplyr语法操作
补充对应写法,同样要覆盖两种空值场景:
library(dplyr) dt_filtered <- dt %>% filter(!is.na(geo_coord), geo_coord != "")
如果操作后仍不符合预期,可以先运行table(is.na(dt$geo_coord), dt$geo_coord == "", useNA = "ifany")查看该列空值的具体分布,再调整判断条件。
内容的提问来源于stack exchange,提问作者Ramon_88
相关产品推荐
相关产品推荐

