【发布时间】:2020-05-18 18:20:42
【问题描述】:
我正在看 here 的 Bahdanau 注意力课程。我注意到上下文向量的最终形状是(batch_size, hidden_size)。我想知道他们是如何得到这种形状的,因为 attention_weights 的形状为(batch_size, 64, 1),而特征的形状为(batch_size, 64, embedding_dim)。他们将两者相乘(我相信这是一个矩阵乘积),然后在第一个轴上求和。上下文向量中的隐藏大小来自哪里?
【问题讨论】:
标签: python tensorflow machine-learning keras attention-model