【问题标题】:In reinforcement learning, what is the difference between optimal policy and piece-wise optimal policy?在强化学习中,最优策略和分段最优策略有什么区别?
【发布时间】:2017-03-09 12:34:37
【问题描述】:

我们如何定义最优策略和分段最优策略?

我想这取决于它是连续时间问题还是离散时间问题。对于离散时间,两者应该相同。我说的对吗?

【问题讨论】:

    标签: machine-learning policy dynamic-controls reinforcement-learning control-theory


    【解决方案1】:

    我想自己添加一个答案。

    分段最优策略是我们贪婪地选择最优动作的策略(即仅在下一个瞬间最优)。然而,最优的将是我们在一个时间范围内选择策略(如在情节 MDP 中)。时间范围的长度取决于应用程序。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-12-05
      • 2019-04-17
      • 2018-02-25
      • 1970-01-01
      • 2019-10-25
      • 2021-08-07
      • 1970-01-01
      • 2016-10-02
      相关资源
      最近更新 更多