【问题标题】:LSTM many-to-many training in batches of independent examples批量独立示例中的 LSTM 多对多训练
【发布时间】:2019-01-21 15:47:48
【问题描述】:

我仍在研究 LSTM,并试图提出最佳和适当的训练例程和数据形状。

时间序列代表音符。让我们称之为一首歌。所以我有以下形式的数据。该系列由单热编码的音符组成。所以他们有形状(timesteps, features)。该系列的副本通过移调(向上移动)系列制作十二次。然后一首歌将成形(12, timesteps, features)。这十二个系列中的每一个都应该独立训练。此外,还有多首长度不同的歌曲。

我想训练一个 LSTM,以便在系列的每一步都进行预测。因此,十二个系列之一的训练数据将是X = series[:-1, :], Y = series[1:, :],并且对于所有十二个版本都是如此。

# Example data, numbers not one-hot encoded for brevity
series = [1, 3, 2, 4, 7, 7, 10]
X = [1, 3, 2, 4, 7, 7]
Y = [3, 2, 4, 7, 7, 10]   # Shifted 1 step back

十二个变体将创建一个自然批次,因为长度不变。但我的问题是:是否可以安排训练,使这些变体以 12 个批次的形式输入网络,但训练是多对多的?(每步一个时间步)一个预测)

目前我有一个似乎是a naïve approach 的例子。它将时间步长一一提供给网络,并保留其间的状态:

# X = (12 * timesteps, 1, features), Y = (12 * timesteps, features)
model = Sequential()
model.add(LSTM(256, input_shape=(None, X.shape[-1]), batch_size=1, stateful=True))
model.add(Dense(Y.shape[-1], activation='softmax'))
model.compile(loss='categorical_crossentropy', optimizer='adam', metrics=['categorical_accuracy'])

for epoch in range(10):
    model.fit(X, Y, epochs=1, batch_size=1, shuffle=False)
    model.reset_states()

对于一首十二变奏曲的歌曲,如何实现上述训练机制?

【问题讨论】:

  • 请确保我理解正确:您希望同时生成所有 12 种变体的预测,对吗?您不想独立生成 12 个预测,然后在预测后聚合它们吗?
  • @today 如果缺少解释,我很抱歉。我的意思是,我将能够同时(批量)训练 12 个变体,并且为每个变体生成每个时间步长的预测。这能回答问题吗?
  • 所以你想为模型提供一个形状为(12, n_timesteps, n_features) 的张量并得到一个形状为(12, n_timesteps, n_features) 的输出,对吧?本质上,给定第一个t 时间步,您想预测t+1 时间步?每首歌曲的长度可能不同,即n_timesteps 每首歌曲的长度不同,但n_features 的长度相同?
  • @today 是的!以前我一直在努力使用 TimeDistributed 包装器,它可能与培训有关,但是:我很缺乏经验。

标签: python machine-learning keras time-series lstm


【解决方案1】:

正如您在评论中提到的,您需要在TimeDistributed 中包装一个 LSTM 层。这样,12 个变体中的每一个都将被单独处理。此外,由于每个特征向量都是单热编码的,我们添加了一个带有softmax 激活的 Dense 层作为我们网络的最后一层:

from keras import models, layers

n_features = 20

model_input = layers.Input(shape=(12, None, n_features))
x = layers.TimeDistributed(layers.LSTM(64, return_sequences=True))(model_input)
model_output = layers.Dense(n_features, activation='softmax')(x)

model = models.Model([model_input], [model_output])
model.compile(loss='categorical_crossentropy', optimizer='rmsprop')
model.summary()

这是模型摘要:

Layer (type)                 Output Shape              Param #   
=================================================================
input_1 (InputLayer)         (None, 12, None, 20)      0         
_________________________________________________________________
time_distributed_1 (TimeDist (None, 12, None, 64)      21760     
_________________________________________________________________
dense_1 (Dense)              (None, 12, None, 20)      1300      
=================================================================
Total params: 23,060
Trainable params: 23,060
Non-trainable params: 0
_________________________________________________________________

请注意,此模型对于您的问题可能非常简单。您可能希望将更多的 LSTM 层堆叠在一起,并根据您要解决的具体问题更改参数以获得更好的准确性(最后您必须进行实验!);但它可以让您大致了解模型在这种情况下的外观。虽然看起来可能有点无关紧要,但我建议你阅读 Keras 官方博客中的Seq2Seq tutorial 以获得更多这方面的想法。

附带说明,如果您使用的是 GPU,那么您可以使用 CuDNNLSTM 层而不是 LSTM;它在 GPU 上提供了更好的性能。

【讨论】:

  • 非常感谢您的回答!这看起来很有希望,但我得等到我回家。再多考虑一下:我已经看到 TimeDistributed 包装器用于 Dense 层。这与包装 LSTM 层有何不同?非常感谢!
  • @Felix TimeDistributed 并非特定于 Dense 层。它可以与任何层一起使用,例如 Conv2D 或 LSTM。它本质上将包装层应用于输入的时间切片(即第三维以上)。
  • 好的,那么包装 LSTM 和 Dense 相等操作,只影响训练?这似乎是一个完全不同的问题,但该死的还有很多要知道的。
  • @Felix 当然不!一个在输入上应用 LSTM 层,另一个应用 Dense 层。不要仅通过查看输出形状来推断这一点!不要忘记我在 LSTM 层中添加了return_sequences=True 参数,以便为我们提供所有时间步长的输出。这就是为什么你看到 LSTM 层的输出形状是(None, 12, None, 64)。如果我们没有这样做,输出形状将是(None, 12, 64),即只返回 LSTM 的最后一个输出。
  • 也许我会在问更多愚蠢的问题之前先调查一下:D 无论如何,这很有帮助。谢谢。
猜你喜欢
  • 1970-01-01
  • 2019-03-22
  • 2020-12-15
  • 2017-08-15
  • 2019-11-14
  • 1970-01-01
  • 2017-08-19
  • 2022-01-22
  • 2017-11-07
相关资源
最近更新 更多