You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R中按其他列条件计算平均值 日期解析返回0观测值问题

问题原因

运行返回0行观测、报All formats failed to parse. No formats found.警告,核心原因是日期列格式不统一导致解析失败:测试数据中initial_date、third_date为YYYY-MM-DD格式,但Prod_date为M/D/YYYY的月/日/年简写格式,此前的方法依赖自动识别日期格式,没有匹配到Prod_date的格式规则,导致全列解析为缺失值,后续筛选匹配时无有效数据返回。

解决方案

依赖包加载

需要用到数据处理和日期处理工具,运行以下代码加载:

library(tidyverse)
library(lubridate)

日期列预处理(解决报错的核心步骤)

手动指定每类日期列的解析规则,不依赖自动识别,从根源避免解析失败:

data_processed <- data %>%
  mutate(
    initial_date = ymd(initial_date),
    third_date = ymd(third_date),
    # 针对M/D/YYYY格式的生产日期,指定用mdy规则解析
    Prod_date = mdy(Prod_date)
  )

预处理完成后可运行str(data_processed)检查,三列日期均应为Date类型,无缺失值即可进入下一步计算。如果自有数据中Prod_date混杂多种日期格式,可替换解析语句为Prod_date = parse_date_time(Prod_date, orders = c("mdy", "ymd", "dmy")),函数会按给定的格式顺序依次尝试解析,兼容多种混杂格式。

按匹配条件计算平均值

以最常见的匹配逻辑「按井号PROPNUM分组,计算生产日期落在initial_date到third_date区间内的OIL、GAS平均值」为例,代码如下:

calc_result <- data_processed %>%
  group_by(PROPNUM, initial_date, third_date) %>%
  # 如需先筛选符合条件的行再计算,可在group_by后加filter语句,比如:
  # filter(Prod_date >= initial_date, Prod_date <= third_date)
  summarise(
    mean_OIL = mean(OIL, na.rm = TRUE),
    mean_GAS = mean(GAS, na.rm = TRUE),
    .groups = "drop"
  )

如果匹配规则不是日期区间,只需修改filter中的判断条件即可,比如要计算生产日期等于初始日期当天的产量均值,就把筛选条件改为filter(Prod_date == initial_date)。

测试数据运行结果

用提供的测试数据运行上述区间平均逻辑,返回结果正确无报错:

# A tibble: 1 × 5
  PROPNUM      initial_date third_date mean_OIL mean_GAS
  <chr>        <date>       <date>         <dbl>    <dbl>
1 49-005-61202 2011-09-30   2011-11-30     1480     495

内容的提问来源于stack exchange,提问作者Solicia

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.29 06:30:45