【发布时间】:2017-01-23 21:58:24
【问题描述】:
我不明白这些网络中最小化的内容。 有人可以解释一下当 LSTM 网络中的损失变小时会发生什么数学问题吗?
model.compile(loss='categorical_crossentropy', optimizer='adam')
【问题讨论】:
标签: deep-learning keras lstm
我不明白这些网络中最小化的内容。 有人可以解释一下当 LSTM 网络中的损失变小时会发生什么数学问题吗?
model.compile(loss='categorical_crossentropy', optimizer='adam')
【问题讨论】:
标签: deep-learning keras lstm
从keras documentation,categorical_crossentropy 只是多类对数损失。对数损失的数学和理论解释here。
基本上,LSTM 为单词(或字符,取决于您的模型)分配标签,并通过惩罚单词(或字符)序列中的错误标签来优化模型。该模型采用输入单词或字符向量,并尝试根据训练示例猜测下一个“最佳”单词。分类交叉熵是衡量猜测好坏的定量方法。随着模型对训练集的迭代,它在猜测下一个最佳单词(或字符)时的错误更少。
【讨论】: