You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言多条件子集化数据集出现全NA结果问题排查

问题原因与解决方法

核心问题

你第二个条件的写法完全错误:PROCEDURE == "%like%MED" 是无效的R语法,导致筛选后没有匹配到任何行,最终得到空数据集,所以summary()输出全为NA。

  • %like%不是R基础包的操作符(它属于SQL或data.table包的语法),你用==去精确匹配字符串"%like%MED",但你的数据里PROCEDURE列根本不存在这个值,因此没有行能同时满足两个条件。
  • 单条件筛选正常是因为NDC == "L1000"确实匹配到了有效行,但错误的第二个条件把结果过滤成了空集。

正确写法

要实现“PROCEDURE列包含'MED'”的模糊匹配,用R基础包的grepl()函数即可:

newmed <- subset(data, NDC == "L1000" & grepl("MED", PROCEDURE), select = GCharge:SelfPay)
summary(newmed)

如果习惯用tidyverse工具链,也可以这么写:

library(dplyr)
library(stringr)

newmed <- data %>%
  filter(NDC == "L1000", str_detect(PROCEDURE, "MED")) %>%
  select(GCharge:SelfPay)
summary(newmed)

额外提示

如果PROCEDURE列存在NA值,可额外添加!is.na(PROCEDURE)条件,避免NA干扰匹配:

newmed <- subset(data, NDC == "L1000" & !is.na(PROCEDURE) & grepl("MED", PROCEDURE), select = GCharge:SelfPay)

内容的提问来源于stack exchange,提问作者Ram193

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.08 11:00:08