所谓PPO(ProximalPolicyOptimization),就是在策略梯度的基础上,使其可以具有Off-Policy的学习能力,同时保证动作执行者和学习者之间差距不要太大,稳扎稳打。
1.Policy Gradient





增加一个衰减discount


2.PPO(ProximalPolicyOptimization)







参考:
相关文章:
-
2021-07-20
-
2021-07-03
-
2022-01-07
-
2021-11-05
-
2021-08-06
-
2021-05-05
-
2021-04-29
-
2021-12-21