如何高效处理压缩时间序列数据集?附模拟数据集实现代码
数据格式介绍与模拟数据集生成代码
嘿,我来给你详细说明下我使用的数据格式,同时附上能生成和我实际处理的原始数据高度相似的模拟数据集代码~
数据格式概述
我处理的是多层分组的时间序列数据集,包含三级分组维度,每条记录都带有时间戳和数值特征,下面是具体的模拟生成代码:
import numpy as np import pandas as pd # 创建模拟数据集 np.random.seed(42) # 设置随机种子保证结果可复现 records = list() # 三层循环生成多分组时间序列数据 for i in range(5): # 一级分组:共5组 for j in range(10): # 二级分组:每个一级分组下10组 for k in range(1000): # 每个二级分组下1000条时间序列记录 # 生成随机时间戳(2000-01-01 至 2020-12-31之间) t = np.random.randint( pd.Timestamp('2000-01-01').value, pd.Timestamp('2020-12-31').value ) # 构造记录字典,可根据需求添加更多特征字段 records.append({ 'group_level_1': i, 'group_level_2': j, 'timestamp': pd.Timestamp(t), 'metric_value': np.random.normal(loc=0, scale=1) # 随机生成正态分布数值 }) # 将记录列表转换为DataFrame格式 simulated_df = pd.DataFrame(records)
这段代码生成的数据集和我实际处理的原始数据结构完全匹配:包含三级分组层级、时间戳字段以及数值型业务指标,你可以根据自己的需求调整分组数量、时间范围或者添加更多特征字段。
内容的提问来源于stack exchange,提问作者Stefan Falk
相关产品推荐
相关产品推荐

