【发布时间】:2017-05-24 11:42:18
【问题描述】:
你有一个策略,它实际上是我所有状态的动作概率分布。价值函数决定了获得最高回报的最佳行动方案。
所以我有一个随机策略。我得到了价值函数。我根据价值函数用新的分布更新我的策略。我得到了这个新更新政策的价值函数并再次重新评估。
根据这个定义,我很难理解价值迭代是如何工作的,我认为这是对价值函数是什么的误解。
价值函数不是最好的行动方案吗?它只是决定奖励的行动方案吗?策略迭代是否只是寻找一个提供比当前奖励更高奖励的价值函数,然后立即更新,从而为我的状态(新策略)提供新的动作分布,然后对其每个状态迭代执行此操作直到收敛?
在这种情况下,值迭代是否会在序列中的每个状态下寻找单个最佳可能操作(而不是更好的操作)?我在这里很难理解为什么一个不会更新政策?
我对政策和价值函数等的理解是否正确?
非常感谢!
我认为我对政策的理解肯定是不正确的:如果政策只是对我所在州的所有可能行动的分布,那么我不完全确定“更新”意味着什么。如果它只是简单地更新分布,那么如果它使用“更糟糕”的分布,那么值迭代究竟如何工作,因为初始化时策略最初不是随机的?我无法理解这些如何收敛并同样好?
【问题讨论】:
-
您在多个帖子中提出多个问题,而不是一个单一的整体问题。
标签: dynamic-programming policy reinforcement-learning