R语言使用case_when()处理因子变量生成新变量的报错解决方案
解决方案
解决核心是保证case_when()所有分支的返回值类型完全一致,以下是两种可落地的实现方式:
方案1:转字符处理后转回因子(扩展性最优)
后续新增换算货币时不需要调整因子逻辑,适配性最强:
library(dplyr) # 定义汇率 CAD_EXCHANGE <- 1.34 EUR_EXCHANGE <- 0.88 df_USD <- df %>% mutate( # 金额转换逻辑保持不变 invoice_converted = case_when( currency == "EUR" ~ round(invoice / EUR_EXCHANGE), currency == "CAD" ~ round(invoice / CAD_EXCHANGE), TRUE ~ invoice ), # 统一转成字符处理,避免类型冲突 currency_converted = case_when( currency %in% c("EUR", "CAD") ~ "USD", TRUE ~ as.character(currency) ), # 按需转回因子,沿用原数据的levels设置,保证类型一致性 currency_converted = factor(currency_converted, levels = levels(currency)) )
运行后输出结果完全符合预期:
> df_USD # A tibble: 5 × 5 shipment invoice currency invoice_converted currency_converted <chr> <dbl> <fct> <dbl> <fct> 1 A 500 USD 500 USD 2 B 500 EUR 568 USD 3 C 500 CAD 373 USD 4 D 500 NA 500 NA 5 E 500 SDD 500 SDD
方案2:直接构造同level因子返回(代码更简洁)
不需要额外的类型转换步骤,直接在分支内返回和原字段同level的因子:
df_USD <- df %>% mutate( invoice_converted = case_when( currency == "EUR" ~ round(invoice / EUR_EXCHANGE), currency == "CAD" ~ round(invoice / CAD_EXCHANGE), TRUE ~ invoice ), currency_converted = case_when( currency %in% c("EUR", "CAD") ~ factor("USD", levels = levels(currency)), TRUE ~ currency ) )
原方案报错原因
- 方案1:
case_when()要求所有分支返回同类型值,匹配分支返回字符型"USD",默认分支返回因子型currency,类型不匹配触发报错。 - 方案2:通过取第一个因子值的方式硬编码依赖USD的level排序,实际场景中因子level顺序不固定,因此不可靠。
- 方案3:
df$currency[df$currency == "USD"]返回的是整个数据集中所有为USD的行,长度和向量运算要求的长度(要么为1,要么和数据集行数一致)不匹配,同时NA值也会被包含在筛选结果中,导致长度错误。
内容的提问来源于stack exchange,提问作者ScottyJ
相关产品推荐
相关产品推荐

