面向预测性维护ML模型的多行列数据最优聚合方法咨询
针对预测性维护ML模型的时序温度数据聚合方案
一、扩展统计特征维度
仅用均值和标准差确实会丢失时序数据的关键细节,可补充以下统计特征,全面刻画温度变化:
- 极值与位置特征:最大值、最小值,以及极值出现的时间点(如第N秒达到最高温),捕捉温度突变的关键时刻
- 分布特征:中位数、25%/75%四分位数、偏度、峰度,反映温度分布的对称性和集中程度
- 趋势特征:线性回归斜率(判断温度整体上升/下降/平稳趋势)、首尾温度差(累计变化量)
- 异常特征:统计超出预设正常温度阈值的次数,直接关联潜在故障信号
二、时序专属特征提取
针对每秒温度的时序特性,提取能体现波动规律的特征:
- 差分特征:计算相邻秒的温度差(一阶差分),再统计差分的均值、标准差、最大值,捕捉温度波动的频率和幅度
- 滑动窗口特征:以5秒/10秒为窗口,计算窗口内的均值、最大值、变化率,保留短期波动模式
- 频域特征:通过快速傅里叶变换(FFT)提取主频率,识别温度波动的周期性规律(需足够数据量支撑)
三、保留原始时序结构的建模方式
若想完全避免聚合丢失信息,可直接基于时序序列建模:
- 固定长度序列补全:将每个事件对应的温度序列补全至事件持续时长(如示例中60秒),缺失值用线性插值或前后值填充,再用LSTM、Transformer等时序模型处理序列,最后与Table A的静态特征(如event)拼接
- 序列嵌入压缩:用Autoencoder对温度序列进行无监督压缩,得到固定维度的嵌入向量,作为Table A每条记录的附加特征,兼顾信息保留与维度可控
四、合并建模实操示例
用Python Pandas实现扩展特征提取与表合并:
import pandas as pd import numpy as np # 加载Table B数据并分组聚合特征 agg_features = table_b.groupby(['Id', 'startTime', 'endTime']).agg( temp_mean=('temp', 'mean'), temp_std=('temp', 'std'), temp_max=('temp', 'max'), temp_min=('temp', 'min'), temp_median=('temp', 'median'), temp_trend_slope=('temp', lambda x: np.polyfit(range(len(x)), x, 1)[0]), temp_fluctuation_mean=('temp', lambda x: x.diff().dropna().mean()), temp_outlier_count=('temp', lambda x: sum(x > 0.4)) # 假设0.4为异常温度阈值 ).reset_index() # 与Table A合并 merged_model_data = pd.merge(table_a, agg_features, on=['Id', 'startTime', 'endTime'])
内容的提问来源于stack exchange,提问作者S R G
相关产品推荐
相关产品推荐

