【发布时间】:2017-06-08 02:05:11
【问题描述】:
根据 Sutton 的书 - Reinforcement Learning: An Introduction,网络权重的更新方程为:
其中 et 是资格跟踪。
这类似于带有额外 et 的梯度下降更新。
此资格跟踪是否可以包含在 TensorFlow 中的 tf.train.GradientDescentOptimizer 中?
【问题讨论】:
-
我假设
theta、e和delta都具有相同的形状,在这种情况下,您只需要梯度的元素乘法吗?这可以通过在使用变量值之前放置自定义渐变的身份操作来完成。如果这听起来不错,我可以举一个例子。 -
没错。
theta、e和delta的形状为[Number_of_classes, 1] -
啊,显然已经有tf.contrib.layers.scale_gradient。这对你有用吗?
-
完美。您可以发布一个示例作为答案吗?
标签: tensorflow gradient-descent reinforcement-learning