【发布时间】:2017-11-10 14:58:36
【问题描述】:
LSTM 的注意力机制是一个直接的 softmax 前馈网络,它接受编码器每个时间步的隐藏状态和解码器的当前状态。
这两个步骤似乎相互矛盾,无法理解: 1) 需要预定义前馈网络的输入数量 2) 编码器的隐藏状态数是可变的(取决于编码时的时间步数)。
我是不是误会了什么?训练是否与训练常规编码器/解码器网络相同,还是必须单独训练注意力机制?
提前致谢
【问题讨论】:
-
这是我遇到的一个很好的注意力可视化:towardsdatascience.com/…
标签: machine-learning neural-network text-processing lstm recurrent-neural-network