【问题标题】:Implementing online learning with time series使用时间序列实施在线学习
【发布时间】:2016-01-15 02:37:51
【问题描述】:

我对时间序列数据有分类问题。

每个示例有 10 个变量,这些变量以不规则的间隔进行测量,最终将对象分为 2 个可能的类别中的 1 个(二元分类)。

我只有示例的最后一课可以在训练期间学习。但是当给出一个新的例子时,我想对每个时间戳进行预测(以在线方式)。因此,如果新示例有 25 个测量值,我想对其类别进行 25 个预测;每个时间戳一个。

我目前实现这一点的方式是使用其 10 个变量的测量值的最小值、平均值和最大值作为分类特征。这是最优的吗?有什么更好的方法。

【问题讨论】:

    标签: python r machine-learning scikit-learn


    【解决方案1】:

    如果您必须在每个时间戳进行预测,那么这不会成为时间序列问题(除非您计划使用之前的观察序列来进行下一个预测,在这种情况下,您需要训练一个基于序列的模型)。假设您只能根据观察到的最终数据训练模型,可以有多种方法,但我建议您使用具有大量树和每棵树中 3 或 4 个变量的随机森林。这样,即使某些变量没有为您提供所需的输入,其他树仍然可以做出相当准确的预测。除此之外,还有许多集成方法。

    您目前正在做的方式可能是一个非常松散的近似值和实用性,但没有太大的统计意义。

    【讨论】:

    • 那么,Timeseries 严格根据之前的值预测下一个值 ?
    • 假设我使用每个数据点的最终类训练了 RF,当我希望预测一个新示例的类时,我应该为 RF 的分类、最小值、平均值和最大值输入哪些特征到那时为止,它的 10 个变量的测量值?
    • 集成方法的想法是,您不使用所有变量来制作单个模型,而是使用变量的几个小子集制作多个模型......所以当您有数据时您的一些变量会因噪声而随时间波动,模型的组合将帮助您更准确地预测值
    • 我们可以拿这个聊天吗?我想知道你对一些微妙之处的看法
    • 在预测每个时间戳时,您可以在这种情况下输入变量的实际值......不需要最小最大值或平均值
    猜你喜欢
    • 2014-12-06
    • 2018-08-26
    • 1970-01-01
    • 1970-01-01
    • 2019-07-24
    • 1970-01-01
    • 1970-01-01
    • 2018-08-11
    • 2017-12-29
    相关资源
    最近更新 更多