You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python调整数据时间截断频率:指定列求和其余列保留

解决时间聚合时部分列求和、部分列保留的问题

要实现30分钟转1小时切片,仅对指定列求和、其余列保留,核心是用groupby.agg()指定每列的聚合规则,而非全量求和或错误合并。

具体步骤与代码

  1. 定义聚合规则字典:明确哪些列需要求和,哪些列需要保留(用first/last,前提是同1小时内这些列的值一致,这是时间切片调整的常规场景)
  2. 执行分组聚合:用pd.Grouper按时间列1小时分组,应用聚合规则

示例代码:

import pandas as pd

# 假设原始DataFrame为df,按需补充需要保留的列
agg_rules = {
    'starts': 'sum',
    'scooters_on_parking': 'sum',
    'area_id': 'first',  # 同小时内列值一致,取首个值即可
    'parking_name': 'first',
    # 添加所有需要保留的列,规则统一用first/last
}

# 执行聚合并重置索引
new_df = df.groupby(pd.Grouper(freq='1H', key='time_')).agg(agg_rules).reset_index()

为什么之前的merge方法会出错

你之前用聚合后再merge的方式,会把原数据中同1小时内的所有行都与聚合结果匹配,导致数据重复、数值被多次关联,最终结果自然偏差很大。直接在groupby阶段指定每列的处理逻辑,才是正确的做法。

特殊情况处理

如果某列在同1小时内存在不同值(业务异常场景),可按需替换聚合规则:

  • 取出现次数最多的值:lambda x: x.mode()[0]
  • 取平均值(数值型列):'mean'

内容的提问来源于stack exchange,提问作者Avan Maric

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.12 20:30:39