You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言重编码间隔时间:按分组规则生成new_var列的问题求助

问题分析与解决方案

原代码的核心问题有三个:

  • 计算均值时没有排除组内的interval_hrs=24的行,导致均值包含24,最终和原列值一致
  • 未处理组内仅一行的特殊场景(需取freqcount并加*标记)
  • 没有添加需求要求的*和mean标记

以下是修正后的dplyr代码,完全匹配需求规则:

library(dplyr)

df1 <- df %>%
  # 注意:as.date是错误写法,R中日期处理函数是as.Date()
  group_by(pid, medname, as.Date(date)) %>%
  mutate(
    # 计算组内非24的interval_hrs均值,提前排除24避免干扰
    mean_non24 = mean(interval_hrs[interval_hrs != 24], na.rm = TRUE),
    # 获取组内数据行数,用于判断是否为单一行组
    group_n = n()
  ) %>%
  mutate(
    new_var = case_when(
      # 规则1:组内仅一行,取freqcount加*标记
      group_n == 1 ~ paste0(freqcount, "*"),
      # 规则2:组内多行且当前行interval_hrs=24,取非24值的均值加mean标记
      interval_hrs == 24 ~ paste0(round(mean_non24, 2), " mean"),
      # 规则3:其余情况取实际interval_hrs值(保留两位小数)
      TRUE ~ as.character(round(interval_hrs, 2))
    )
  ) %>%
  # 清理临时计算的辅助列
  select(-mean_non24, -group_n) %>%
  ungroup()

head(df1, 10)

代码关键点说明

  • 分组时修正了as.date为R标准的as.Date()函数,避免语法错误
  • 新增mean_non24专门计算组内排除24后的均值,确保规则2的取值正确
  • 用case_when替代ifelse,更清晰地处理多分支逻辑
  • 所有场景都按需求添加了对应的标记(*或mean),输出为字符型列(若需保留数值+标记,只能用字符型存储)

内容的提问来源于stack exchange,提问作者db2020

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.22 11:38:22