【问题标题】:What is the difference between model and policy w.r.t reinforcement learning模型和策略 w.r.t 强化学习有什么区别
【发布时间】:2019-12-05 11:06:01
【问题描述】:

两个定义似乎都表明它们是从状态映射到动作,那么有什么区别还是我错了?

【问题讨论】:

  • 嗨,欢迎来到 Stack Overflow。关于机器学习的问题应该去 stats.stackexchange.com 上的交叉验证。祝你好运!

标签: model reinforcement-learning policy mdp


【解决方案1】:

这篇文章真的为你总结了一下:
What is Model-Based Reinforcement Learning?

模仿还是不模仿

“模型”是机器学习(以及更普遍的科学学科)中经常出现的术语之一,通常对我们的意思的解释相对模糊。幸运的是,在强化学习中,模型具有非常特定的含义:它指的是环境的不同动态状态以及这些状态如何导致奖励。

...政策是您根据当前状态/位置确定采取何种行动/方向的任何策略。

强化学习(或任何真正的学习)的总体结果是制定一项政策,即在呈现特定领域时要采取的一系列行为或行动。

强化因素是您根据先前学习的结果不断地重新运行学习过程,有效地应用新策略并从结果中学习以改进策略。

在基于模型的强化学习中,我们使用模型来表示环境或领域,它记录了事实或状态以及可能的行动。通过了解某些事实,策略可以在每个重复周期中专门针对这些状态和动作,测试和提高策略的准确性,就像它提高模型的质量一样。

另一种看待两者的方式是,模型是先前学习的记录或结果,它是环境的更新视图。该模型处理事实或假设的事实,基于过去的政策执行结果,模型保存了过去执行的记录,这些数据可用于近似从特定状态下采取某些行动的结果。政策是对行为的实际学习,而模型是支持和确认我们学习的事实。

同一篇文章中的这张图简化了强化学习中model和policy之间的关系:

【讨论】:

    猜你喜欢
    • 2019-04-17
    • 2016-10-24
    • 1970-01-01
    • 2018-11-05
    • 2018-02-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-10-11
    相关资源
    最近更新 更多