【发布时间】:2020-03-09 04:34:42
【问题描述】:
我创建了一个自定义的健身房环境,其中操作可以是从 -100 到 +100 的任何整数。据我所见,不可能创建一个允许负值的离散空间,而我提供的唯一解决方案是创建一个从 -100 到 +100 的 Box 空间(注意这是一个连续空间)。
由于大多数强化学习代理都假设动作空间是离散空间,因此我在运行代码时遇到了困难(我知道有一些代理,例如 DDPG,在连续动作空间中运行)。
有可能在健身房中有一个允许负值的离散空间吗?
【问题讨论】:
标签: python python-3.x reinforcement-learning openai-gym