【发布时间】:2019-12-05 11:06:01
【问题描述】:
两个定义似乎都表明它们是从状态映射到动作,那么有什么区别还是我错了?
【问题讨论】:
-
嗨,欢迎来到 Stack Overflow。关于机器学习的问题应该去 stats.stackexchange.com 上的交叉验证。祝你好运!
标签: model reinforcement-learning policy mdp
两个定义似乎都表明它们是从状态映射到动作,那么有什么区别还是我错了?
【问题讨论】:
标签: model reinforcement-learning policy mdp
这篇文章真的为你总结了一下:
What is Model-Based Reinforcement Learning?
模仿还是不模仿
“模型”是机器学习(以及更普遍的科学学科)中经常出现的术语之一,通常对我们的意思的解释相对模糊。幸运的是,在强化学习中,模型具有非常特定的含义:它指的是环境的不同动态状态以及这些状态如何导致奖励。
...政策是您根据当前状态/位置确定采取何种行动/方向的任何策略。
强化学习(或任何真正的学习)的总体结果是制定一项政策,即在呈现特定领域时要采取的一系列行为或行动。
强化因素是您根据先前学习的结果不断地重新运行学习过程,有效地应用新策略并从结果中学习以改进策略。
在基于模型的强化学习中,我们使用模型来表示环境或领域,它记录了事实或状态以及可能的行动。通过了解某些事实,策略可以在每个重复周期中专门针对这些状态和动作,测试和提高策略的准确性,就像它提高模型的质量一样。
另一种看待两者的方式是,模型是先前学习的记录或结果,它是环境的更新视图。该模型处理事实或假设的事实,基于过去的政策执行结果,模型保存了过去执行的记录,这些数据可用于近似从特定状态下采取某些行动的结果。政策是对行为的实际学习,而模型是支持和确认我们学习的事实。
同一篇文章中的这张图简化了强化学习中model和policy之间的关系:
【讨论】: