【问题标题】:Predictions with ARIMA (python statsmodels)使用 ARIMA 进行预测(python statsmodels)
【发布时间】:2016-04-21 22:28:34
【问题描述】:

我有一些时间序列数据,其中包含一些季节性趋势,我想使用 ARIMA 模型来预测该序列未来的表现。

为了预测我感兴趣的变量 (log_var) 的表现,我采用了每周、每月和每年的差异,然后将这些差异用作 ARIMA 模型的输入。

下面是一个例子。

exog = np.column_stack([df_arima['log_var_diff_wk'], 
                        df_arima['log_var_diff_mth'], 
                        df_arima['log_var_diff_yr']]) 

model = ARIMA(df_arima['log_var'], exog = exog, order=(1,0,1)) 
results_ARIMA = model.fit()  

我正在为几个不同的数据源执行此操作,并且在所有这些数据源中我都看到了很好的结果,因为如果我将 log_varresults_ARIMA.fittedvalues 绘制成训练数据,那么它匹配得非常好(我调整 p 和q 分别用于每个数据源,但 d 始终为 0,因为我自己已经采取了差异)。

但是,然后我想检查预测的样子,为了做到这一点,我将 exog 重新定义为“测试”数据集。例如,如果我在 2014 年 1 月 1 日到 2016 年 1 月 1 日训练原始 ARIMA 模型,则“测试”集将是 2016 年 1 月 1 日起。

我的方法对某些数据源效果很好(从某种意义上说,我根据已知值绘制预测并且趋势看起来很合理),但对其他数据源却很糟糕,尽管它们都是相同的“类型”数据并且它们具有刚刚从不同的地理位置拍摄。在某些地方,它完全无法捕捉到每年同一日期在训练数据中一次又一次出现的明显季节性趋势。 ARIMA 模型总是能很好地拟合训练数据,只是在某些情况下,预测似乎完全没用。

我现在想知道我是否真的按照正确的程序从 ARIMA 模型中预测值。我的做法基本上是:

exog = np.column_stack([df_arima_predict['log_val_diff_wk'], 
                        df_arima_predict['log_val_diff_mth'], 
                        df_arima_predict['log_val_diff_yr']])

arima_predict = results_ARIMA.predict(start=training_cut_date, end = '2017-01-01', dynamic = False, exog = exog)

这是使用 ARIMA 进行预测的正确方法吗?

如果是这样,当 ARIMA 模型似乎在两种情况下都适合训练数据时,我是否可以尝试理解为什么预测在某些数据集中看起来非常好而在其他数据集中看起来很糟糕?

【问题讨论】:

  • 如果对 ARIMA 的作用没有太多了解,您可能只是过度拟合了您的模型。过度拟合是机器学习中一个非常常见的问题,当你训练你的模型以完美匹配你的训练数据时会发生这种情况,但是它在预测测试集时是没有用的(似乎是正在发生的事情)。如果是问题(很难说),您可以尝试使用参数,直到训练集上的拟合足够好但不完美,ARIMA 可能会更好地泛化到测试数据集。

标签: python time-series prediction statsmodels


【解决方案1】:

我有一个类似的问题,我还没有完全弄清楚。在 python 中包含多个季节性术语似乎仍然有点棘手。 R 似乎确实有这种能力,see here。因此,我可以给您的一个建议是尝试使用 R 目前提供的更复杂的功能(尽管如果您还不熟悉 R,这可能需要大量时间投入)。

查看您对季节性模式进行建模的方法,采用 n 阶差异分数不会为您提供季节性常数,而是您指定为与季节性相关的时间点之间的差异的一些表示。如果这些差异很小,则对它们进行校正可能不会对您的建模结果产生太大影响。在这种情况下,模型预测结果可能会相当好。相反,如果差异很大,包括它们很容易扭曲预测结果。这可以解释您在建模结果中看到的变化。那么,从概念上讲,您想要做的是表示随时间变化的常数。

在上面引用的博文中,作者提倡使用傅里叶级数对每个时间段内的方差进行建模。 NumPy 和 SciPy 包都提供了计算快速傅里叶变换的例程。然而,作为一名非数学家,我发现很难确定快速傅里叶变换是否产生了适当的数字。

最后我选择使用 SciPy 的信号模块中的 Welch 信号分解。这样做是返回时间序列的频谱密度分析,从中可以推断出时间序列中不同频率的信号强度。

如果您在频谱密度分析中识别出与您试图在时间序列中考虑的季节性频率相对应的峰值,则可以使用它们的频率和幅度来构建代表季节性变化的正弦波。然后,您可以将这些作为外生变量包含在您的 ARIMA 中,就像博文中的傅立叶项一样。

这大约是我目前所了解的 - 现在我试图弄清楚我是否可以让 statsmodels ARIMA 过程使用这些指定季节性趋势的正弦波作为我的外生变量模型(文档指定它们不应该代表趋势,但是嘿,一个人可以做梦,对吗?)编辑:This Rob Hyneman 的博客文章也具有高度相关性,并解释了包括傅里叶项在内的一些基本原理。

很抱歉,我无法为您提供在 Python 中被证明有效的解决方案,但我希望这可以为您提供一些新的想法来控制令人讨厌的季节性变化。

TL;DR:

  • 目前看来 python 不太适合处理多个季节性术语,R 可能是更好的解决方案(请参阅参考资料);

  • 使用差异分数来解释季节性趋势似乎无法捕捉与季节重复相关的恒定方差;

  • 在 python 中执行此操作的一种方法是使用表示季节性趋势的傅里叶级数(另请参阅参考资料),除其他方式外,可以使用 Welch 信号分解来获得。但是,如何在 ARIMA 中将这些用作外生变量以达到良好效果是一个悬而未决的问题。

祝你好运,

永远

p.s.:如果我找到一种方法让它在 Python 中工作,我会更新

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2016-02-13
    • 2021-03-01
    • 1970-01-01
    • 2019-05-06
    • 1970-01-01
    • 2018-01-17
    • 2016-12-08
    • 2017-09-13
    相关资源
    最近更新 更多