【发布时间】:2021-01-21 07:46:56
【问题描述】:
你好 Stack Overflow 社区!
目前,我正在关注 David Silver 的强化学习讲座,并且在他的“无模型控制”幻灯片中的某个时刻感到非常困惑。
在幻灯片中,Q-Learning 被认为是离策略学习。我无法理解这背后的原因。他还提到我们有目标和行为政策。行为策略在 Q-Learning 中的作用是什么?
当我查看算法时,它看起来非常简单,就像使用最大 Q(s',a') 函数更新您的 Q(s,a) 估计值。幻灯片中说“我们使用行为策略选择下一个动作”,但这里我们只选择最大值。
我对 Q-Learning 算法感到很困惑。你能帮帮我吗?
幻灯片链接(第 36-38 页): http://www0.cs.ucl.ac.uk/staff/d.silver/web/Teaching_files/control.pdf
【问题讨论】:
标签: reinforcement-learning q-learning