ARIMA参数选择:用训练集还是全量数据?Auto ARIMA输入疑问
ARIMA建模参数选择的核心原则:拒绝数据泄露
绘制ACF/PACF图确定p、q参数:必须用训练集
真实预测场景里,你不可能拿到未来的测试集数据,所以参数识别阶段只能基于训练集(即历史数据)。如果用全量数据,相当于提前泄露了未来的测试集信息,选出来的p、q会过度适配包含未来数据的整体序列,导致模型在测试集上的评估结果虚高,但实际泛化到新数据时表现拉胯。Auto ARIMA:仅输入训练集
Auto ARIMA是自动遍历搜索最优p、d、q组合,本质和手动看ACF/PACF是同一个逻辑——只能用训练数据。输入全量数据的话,算法会把测试集的未来信息纳入参数选择,选出来的模型是拟合全量数据的,不是仅基于历史的预测模型,这样测试集的评估结果毫无参考价值,因为模型已经提前“见过”测试数据了。
两种数据结果不同的原因很直接:全量数据包含了训练集没有的未来信息,参数选择的逻辑完全偏离了真实预测场景。记住核心准则:所有和模型训练、参数选择相关的步骤,都只能用训练集,测试集唯一的作用就是评估模型的泛化能力。
内容的提问来源于stack exchange,提问作者Ne04ever
相关产品推荐
相关产品推荐

