所谓PPO(ProximalPolicyOptimization),就是在策略梯度的基础上,使其可以具有Off-Policy的学习能力,同时保证动作执行者和学习者之间差距不要太大,稳扎稳打。

1.Policy Gradient

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅
【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅
【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅
增加一个衰减discount
【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

2.PPO(ProximalPolicyOptimization)

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅
【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

【学习笔记】PPO(Proximal Policy Optimization) - 李宏毅

参考:

相关文章:

  • 2021-07-20
  • 2021-07-03
  • 2022-01-07
  • 2021-11-05
  • 2021-08-06
  • 2021-05-05
  • 2021-04-29
  • 2021-12-21
猜你喜欢
  • 2021-09-17
  • 2021-05-18
  • 2021-07-17
  • 2021-06-07
  • 2021-08-18
  • 2021-12-05
  • 2021-11-23
相关资源
相似解决方案