【发布时间】:2020-10-29 09:21:13
【问题描述】:
我需要训练一个 RL 代理,它必须控制一些开关。让我们想象一下,我们有 n 个开关,可以打开 (1) 或关闭 (0)。我的代理必须在每个步骤中决定要撕裂和转向哪一个,所以我希望动作如下所示: [1,0,1,....1] - 由 n 个二进制元素组成的向量。
如何训练代理?除了 DQN 之外,还可以将给定的动作空间转换为具有 2^n 个动作的谨慎空间?
【问题讨论】:
-
Artificial Intelligence Stack Exchange 可能是提出与强化学习相关的理论问题的更好地方,所以我建议您在那里提出问题。如果你在那里问,请从这里删除(以避免交叉发布,这通常是不鼓励的)。
标签: reinforcement-learning q-learning