【问题标题】:Statsmodels OLS with rolling window problem具有滚动窗口问题的 Statsmodels OLS
【发布时间】:2019-06-06 17:18:05
【问题描述】:

我想用滚动窗口进行回归,但回归后我只得到一个参数:

 rolling_beta = sm.OLS(X2, X1, window_type='rolling', window=30).fit()
 rolling_beta.params

结果:

 X1    5.715089
 dtype: float64

可能是什么问题?

提前致谢,罗兰

【问题讨论】:

  • 六个月后我没有看到任何迹象表明 window_type='rolling' 是 statsmodels 接口的一部分。也许你检查了这个并且它正在发展?对“window_type”的搜索只显示了一个私有函数 _window_ols。
  • 此外,这个问题和几个类似问题的答案是基于重新制定和独立调用 sm.OLS 每个步骤。这是一种低效的滚动回归方式,统计学家可以理解这一点——例如参见stats.stackexchange.com/questions/6920/… 的参考文献。使用更新方法(整个 Givens 轮换)这样做有很大的经济性。如果您想要交钥匙,暂时这意味着将其运送到 R 可能不适用于您的问题环境
  • @RolandSzarka 正如 Eli S 所指出的,window=30) 方法似乎并不存在。因此,如果我的建议对您有所帮助,您会考虑将其标记为已接受的答案吗?我看到您现在已经提出了 7 个问题,并收到了很多很好的建议,但仍然没有一次接受答案。接受答案是一件好事,因为它使那些寻找未回答问题的人更容易提供帮助和建议。
  • @Roland Szarka 我的建议对你有什么效果?

标签: python regression


【解决方案1】:

我认为问题在于参数window_type='rolling'window=30 根本不做任何事情。首先我会告诉你为什么,最后我会提供一个我已经准备好的用于滚动窗口的线性回归的设置。


1.你的函数的问题:

由于您没有提供一些示例数据,这里有一个函数,它返回一个带有一些随机数的所需大小的数据框:

# Function to build synthetic data
import numpy as np
import pandas as pd
import statsmodels.api as sm
from collections import OrderedDict

def sample(rSeed, periodLength, colNames):

    np.random.seed(rSeed)
    date = pd.to_datetime("1st of Dec, 1999")   
    cols = OrderedDict()

    for col in colNames:
        cols[col] = np.random.normal(loc=0.0, scale=1.0, size=periodLength)
    dates = date+pd.to_timedelta(np.arange(periodLength), 'D')

    df = pd.DataFrame(cols, index = dates)
    return(df)

输出:

X1        X2
2018-12-01 -1.085631 -1.294085
2018-12-02  0.997345 -1.038788
2018-12-03  0.282978  1.743712
2018-12-04 -1.506295 -0.798063
2018-12-05 -0.578600  0.029683
.
.
.
2019-01-17  0.412912 -1.363472
2019-01-18  0.978736  0.379401
2019-01-19  2.238143 -0.379176

现在,试试:

rolling_beta = sm.OLS(df['X2'], df['X1'], window_type='rolling', window=30).fit()
rolling_beta.params

输出:

X1   -0.075784
dtype: float64

这至少也代表了您的输出结构,这意味着您期望每个示例窗口都有一个估计值,但您得到的是一个估计值。因此,我在网上和 statsmodels 文档中四处寻找使用相同功能的其他示例,但我无法找到实际有效的具体示例。我确实找到了一些讨论,讨论了不久前该功能是如何被弃用的。然后我用一些虚假的参数输入测试了相同的函数:

rolling_beta = sm.OLS(df['X2'], df['X1'], window_type='amazing', window=3000000).fit()
rolling_beta.params

输出:

X1   -0.075784
dtype: float64

如您所见,估计值是相同的,并且不会为虚假输入返回错误消息。所以我建议你看看下面的函数。这是我为执行滚动回归估计而汇总的。


2. 用于对 pandas 数据框的滚动窗口进行回归的函数

df = sample(rSeed = 123, colNames = ['X1', 'X2', 'X3'], periodLength = 50)

def RegressionRoll(df, subset, dependent, independent, const, win, parameters):
    """
    RegressionRoll takes a dataframe, makes a subset of the data if you like,
    and runs a series of regressions with a specified window length, and
    returns a dataframe with BETA or R^2 for each window split of the data.

    Parameters:
    ===========

    df: pandas dataframe
    subset: integer - has to be smaller than the size of the df
    dependent: string that specifies name of denpendent variable
    inependent: LIST of strings that specifies name of indenpendent variables
    const: boolean - whether or not to include a constant term
    win: integer - window length of each model
    parameters: string that specifies which model parameters to return:
                BETA or R^2

    Example:
    ========
        RegressionRoll(df=df, subset = 50, dependent = 'X1', independent = ['X2'],
                   const = True, parameters = 'beta', win = 30)

    """

    # Data subset
    if subset != 0:
        df = df.tail(subset)
    else:
        df = df

    # Loopinfo
    end = df.shape[0]
    win = win
    rng = np.arange(start = win, stop = end, step = 1)

    # Subset and store dataframes
    frames = {}
    n = 1

    for i in rng:
        df_temp = df.iloc[:i].tail(win)
        newname = 'df' + str(n)
        frames.update({newname: df_temp})
        n += 1

    # Analysis on subsets
    df_results = pd.DataFrame()
    for frame in frames:
        #print(frames[frame])

        # Rolling data frames
        dfr = frames[frame]
        y = dependent
        x = independent

        if const == True:
            x = sm.add_constant(dfr[x])
            model = sm.OLS(dfr[y], x).fit()
        else:
            model = sm.OLS(dfr[y], dfr[x]).fit()

        if parameters == 'beta':
            theParams = model.params[0:]
            coefs = theParams.to_frame()
            df_temp = pd.DataFrame(coefs.T)

            indx = dfr.tail(1).index[-1]
            df_temp['Date'] = indx
            df_temp = df_temp.set_index(['Date'])

        if parameters == 'R2':
            theParams = model.rsquared
            df_temp = pd.DataFrame([theParams])
            indx = dfr.tail(1).index[-1]
            df_temp['Date'] = indx
            df_temp = df_temp.set_index(['Date'])
            df_temp.columns = [', '.join(independent)]
        df_results = pd.concat([df_results, df_temp], axis = 0)

    return(df_results)


df_rolling = RegressionRoll(df=df, subset = 50, dependent = 'X1', independent = ['X2'], const = True, parameters = 'beta',
                                     win = 30)

输出:对于数据的每个 30 个周期窗口,X1 上 X2 的 OLS 具有 beta 估计值的数据框。

const        X2
Date                          
2018-12-30  0.044042  0.032680
2018-12-31  0.074839 -0.023294
2019-01-01 -0.063200  0.077215
.
.
.
2019-01-16 -0.075938 -0.215108
2019-01-17 -0.143226 -0.215524
2019-01-18 -0.129202 -0.170304

【讨论】:

    猜你喜欢
    • 2021-09-20
    • 2017-11-29
    • 2020-11-23
    • 2023-02-15
    • 2019-06-24
    • 2020-03-06
    • 2014-01-23
    • 1970-01-01
    • 2018-10-17
    相关资源
    最近更新 更多