【问题标题】:Encoding Time Series Forecasting with LSTM Networks使用 LSTM 网络编码时间序列预测
【发布时间】:2018-04-09 09:28:46
【问题描述】:

我有一个大数据集,其中包含以下形式的条目:

user_id、measurement_date、value1、value2、..

出现的挑战是如何处理数据中的空白。 测量是随机进行的,因此总会有更小和非常大的差距。

这里处理缺失数据的最佳方法是什么。

我正在考虑以下方法:

  • 对于所有不存在的测量值,请使用特殊向量。 (这会导致不实用的训练数据,因为非测量条目会接管)
  • 与上述类似,但将多个非测量值组合到一个向量中,例如。引入一个表示未进行测量的天数的向量。

我现在的问题是最好的编码方式是什么。

目前 LSTM 网络以未编码输入向量的形式获取输入:

vector1, vector2,..

向量包含值。

但现在当我引入新符号时:

  s1 := <=3 days no measurement taken
  s2 := <=7 ..

我会对它们进行热编码。

最好引入一个前缀来区分这两种词类型吗?

例如

 1 vector -> 1, value1, value2
 0 vecotr -> 0, 0, 1 (s1)
          -> 0, 1, 0 (s2)

【问题讨论】:

    标签: machine-learning encoding lstm recurrent-neural-network training-data


    【解决方案1】:

    实际上,无论哪种方式都无法对其进行编码。

    【讨论】:

      猜你喜欢
      • 2014-11-16
      • 2019-02-26
      • 2020-09-15
      • 2018-10-01
      • 2018-09-22
      • 2017-08-02
      • 1970-01-01
      • 2017-10-03
      • 2020-07-21
      相关资源
      最近更新 更多