针对月度降雨量预测的SARIMA模型优化及替代方法咨询
降雨量时序预测问题背景
- 数据:某地区过去20年的月度降雨量数据
- 目标:预测该地区未来2年的月度降雨量

优化方案
现有SARIMA模型优化方法
- 先做数据变换处理:降雨量数据普遍为右偏分布,高峰值属于尾端极端值,建模前先做
Box-Cox变换或者对数变换(数据存在0值时可先加极小常数再变换),预测完成后再反变换回原尺度,能显著提升尾端峰值的拟合效果 - 调整SARIMA阶数参数:不要直接使用自动参数搜索的默认结果,结合残差的ACF/PACF图手动调整阶数,针对高峰值对应的序列相关性,适当提升AR阶数
p、季节性AR阶数P,必要时可提高差分阶数d/D - 升级为
SARIMAX引入外生变量:降雨量高峰通常和厄尔尼诺指数、当地季风强度、汛期气候预警指标等强相关,将这些已知的驱动因子作为外生变量加入模型,可直接解释峰值的生成逻辑,大幅提升峰值捕捉能力 - 调整训练损失权重:默认SARIMA使用平方误差损失,对高峰值的拟合误差惩罚不足,改用加权最小二乘法训练,给汛期、历史峰值对应的样本赋予更高的训练权重,强制模型优先拟合高峰区间
替代模型方案
- SARIMA-GARCH组合模型:降雨量高峰属于典型的波动率聚集现象,GARCH族模型可以专门捕捉序列的异方差特征,和SARIMA组合后可以同时拟合序列的均值规律和波动规律,精准覆盖高峰区间
- 树类时序回归模型:使用LightGBM、XGBoost等树模型做时序回归,手动构造月份、季度、历史同期均值、滚动标准差、汛期标识等季节特征,树模型对非线性、非对称的峰值拟合效果远优于线性SARIMA模型,还能自动处理样本中的异常值
- 补充极端值专项建模:单独抽取历史所有降雨量超过75%分位数的峰值样本,用广义帕累托分布(GPD)拟合极端值的分布规律,将主模型的预测结果和极端值的概率预测结果结合,修正高峰区间的预测值
内容的提问来源于stack exchange,提问作者noob
相关产品推荐
相关产品推荐

