【发布时间】:2018-01-05 21:19:40
【问题描述】:
所以我有一个名为W 的tf.Variable(),它属于shape=[1]。
我知道tf.hessians(loss, W) 不等于tf.gradients(tf.gradients(loss, W), W),尽管它应该是同一件事:二阶导数。
下面是代码的一个小要点,如果我尝试用双梯度替换 Hessians,我会遇到问题: https://gist.github.com/guillaume-chevalier/6b01c4e43a123abf8db69fa97532993f 然而,我发现如果我使用双梯度,结果不会收敛。
【问题讨论】:
标签: tensorflow mathematical-optimization gradient-descent derivative