【发布时间】:2018-12-01 08:28:11
【问题描述】:
我想在 OpenAI 的 Bipedal Walker v2 中实现 Q-learning,但在寻找教程后,它们似乎总是有限的环境,这使得 Q 矩阵和奖励矩阵易于初始化。
例如:http://mnemstudio.org/path-finding-q-learning-tutorial.htm
我唯一的问题是,在更开放的环境(例如我想要使用的环境)中,这些矩阵的维度应该是多少?
有问题的环境:https://gym.openai.com/envs/BipedalWalker-v2/
您得到的观察结果(请注意,有些值可能是无限的):https://github.com/openai/gym/wiki/BipedalWalker-v2
【问题讨论】:
标签: python deep-learning reinforcement-learning q-learning openai-gym