【发布时间】:2017-11-07 17:42:55
【问题描述】:
我已经为一个类似于http://curvefever.io/ 的游戏实现了一个自定义的 openai 健身房环境,但使用谨慎的操作而不是连续的操作。所以我的代理可以在每一步中向左/上/右/下四个方向之一前进。然而,这些动作之一总是会导致代理自己崩溃,因为它不能“逆转”。
目前我只是让代理采取任何行动,如果它采取无效行动就让它死亡,希望它最终会学会在那种状态下不采取该行动。但是,我读过可以将非法移动为零的概率设置为,然后对动作进行采样。有没有其他方法可以解决这个问题?
【问题讨论】:
标签: reinforcement-learning openai-gym