处理职业暴露数据时dplyr的summarise警告,是否需换用reframe?
职业暴露时长计算的dplyr警告问题解答
问题背景
用户需计算大型职业暴露数据库中,每个研究对象对每种暴露因素的暴露时长,要求重叠年份仅统计一次。使用的数据集datatest结构如下:
structure(list(ID = c(2, 2, 2, 2, 7, 7, 15, 18, 18, 18, 18, 18, 20, 20, 20), JOB = c(1, 2, 7, 8, 1, 1, 1, 1, 2, 4, 2, 3, 3, 4, 6), AGENT = c("A", "A", "B", "B", "B", "A", "A", "D", "D", "D", "A", "A", "C", "C", "C"), YEARIN = c(1998, 1996, 1979, 1978, 1973, 1973, 1979, 1976, 1980, 1970, 1978, 1984, 1988, 1996, 2000), YEAROUT = c(2009, 2000, 1985, 1982, 2006, 2006, 2007, 1985, 2008, 2005, 1979, 1995, 1993, 2002, 2008)), class = c("tbl_df", "tbl", "data.frame"), row.names = c(NA, -15L))
用户使用以下代码计算暴露时长:
datatest %>% group_by(ID, JOB, AGENT) %>% summarise(year = seq(YEARIN, YEAROUT, by=1)) %>% unnest(year) %>% group_by(ID, AGENT) %>% summarise(nyear = length(unique(year)))
运行后收到警告:
Warning message:
Returning more (or less) than 1 row persummarise()group was
deprecated in dplyr 1.1.0.
ℹ Please usereframe()instead.
ℹ When switching fromsummarise()toreframe(), remember thatreframe()always returns an ungrouped data frame and adjust
accordingly.
Calllifecycle::last_lifecycle_warnings()to see where this warning
was generated.
用户疑问:是否必须改用reframe(),还是仍可继续使用summarise()?
解答
- 不是必须立刻替换,但建议逐步迁移到
reframe()- 该警告是dplyr 1.1.0版本开始的弃用提示:
summarise()原本允许返回多行结果的用法被标记为过时,未来版本可能会彻底移除该支持。 - 当前你的代码仍能正常运行,但后续dplyr更新后可能会直接报错。
- 该警告是dplyr 1.1.0版本开始的弃用提示:
- 修改方法:将第一个
summarise()替换为reframe()即可,因为seq(YEARIN, YEAROUT, by=1)会生成多行结果,属于reframe()的典型适用场景:datatest %>% group_by(ID, JOB, AGENT) %>% reframe(year = seq(YEARIN, YEAROUT, by=1)) %>% # 替换summarise为reframe unnest(year) %>% group_by(ID, AGENT) %>% summarise(nyear = length(unique(year))) - 注意:
reframe()返回的是未分组的数据框,但在这个流程中后续还有group_by()操作,因此不会影响最终计算结果。
内容的提问来源于stack exchange,提问作者R_help
相关产品推荐
相关产品推荐

