【问题标题】:Neural Network and Temporal Difference Learning神经网络和时间差异学习
【发布时间】:2014-06-07 17:57:11
【问题描述】:

我阅读了几篇关于时间差分学习的论文和讲座(其中一些与神经网络有关,例如关于 TD-Gammon 的 Sutton 教程),但我很难理解这些方程,这导致我问题。

-预测值V_t从何而来?然后,我们如何得到 V_(t+1)?

-当 TD 与神经网络一起使用时,究竟返回传播的是什么?也就是在使用TD的时候,传回来的错误是从哪里来的?

【问题讨论】:

    标签: artificial-intelligence neural-network backpropagation reinforcement-learning temporal-difference


    【解决方案1】:

    后向视图和前向视图可能会令人困惑,但是当您处理一些简单的事情(如游戏程序)时,实际上事情实际上非常简单。我没有查看您使用的参考资料,所以我只提供一个总体概述。

    假设我有一个类似神经网络的函数逼近器,它有两个函数,trainpredict,用于对特定输出进行训练并预测状态的结果。 (或在给定状态下采取行动的结果。)

    假设我有玩游戏的痕迹,我使用predict 方法告诉我在每一点要采取什么行动,并假设我在游戏结束时输了(V=0)。假设我的状态是 s_1、s_2、s_3...s_n。

    蒙特卡罗方法说我使用轨迹和最终分数在轨迹中的每个状态上训练我的函数逼近器(例如我的神经网络)。因此,鉴于此跟踪,您将执行类似调用的操作:

    train(s_n, 0) train(s_n-1, 0) ... train(s_1, 0).

    也就是说,我要求每个州预测跟踪的最终结果。

    动态规划方法说我根据下一个状态的结果进行训练。所以我的训练会是这样的

    train(s_n, 0) train(s_n-1, test(s_n)) ... train(s_1, test(s_2)).

    也就是说,我要求函数逼近器预测下一个状态预测的内容,最后一个状态预测跟踪的最终结果。

    TD 学习混合了这两种情况,其中λ=1 对应于第一种情况(蒙特卡罗),λ=0 对应于第二种情况(动态规划)。假设我们使用λ=0.5。那么我们的训练将是:

    train(s_n, 0) train(s_n-1, 0.5*0 + 0.5*test(s_n)) train(s_n-2, 0.25*0 + 0.25*test(s_n) + 0.5*test(s_n-1)+) ...

    现在,我在这里写的内容并不完全正确,因为您实际上并没有在每一步都重新测试逼近器。相反,您只需从一个预测值开始(在我们的示例中为V = 0),然后更新它以使用下一个预测值训练下一步。 V = λ·V + (1-λ)·test(s_i).

    这比蒙特卡罗和动态编程方法学习得快得多,因为您没有要求算法学习这些极端值。 (忽略当前预测或忽略最终结果。)

    【讨论】:

    • 实际上,我希望输入是当前状态和可能的控制信号,输出类似于关卡上的预期进度。通过这种方式,您将在每一步测试所有可能的控制信号并选择具有最佳输出的信号。您的最终奖励将是关卡的进度(也许通过关卡可以获得特殊奖励)。
    • 在这个方案中,如果在一定时间后没有前进的进度,您可能希望使关卡超时。但是,除了使用 NN 玩关卡所获得的经验之外,您不需要任何训练数据。我希望看到的是它首先学会向右移动。然后它学会了跳跃。然后,必须根据这些特征学习更精细的行为。请注意,您可能希望提取特征(例如敌人或坑在哪里)以使学习更容易。
    猜你喜欢
    • 1970-01-01
    • 2014-05-29
    • 2016-07-11
    • 2020-05-15
    • 2016-05-01
    • 2017-08-24
    • 1970-01-01
    • 2016-05-25
    • 2019-03-15
    相关资源
    最近更新 更多