【发布时间】:2019-06-05 07:42:54
【问题描述】:
是否可以将一个神经网络的输出视为两组或更多组输出?
我再解释一下自己(在 q 学习环境中):
假设我在同一个环境中有两个代理,每个代理 有不同数量的可执行动作。两位经纪人 将具有包含环境变量的相同输入向量 选择他们的行动。
问题是:
我可以使用独特的神经网络来控制两个代理吗?
一个例子:
代理 1 有 3 个可执行操作,代理 2 只有 2 个可执行操作 行动。重要的是代理人必须工作 合作使回报最大化。我可以使用 1 个神经网络吗 5 个输出选择对两个代理执行的最佳操作?像 网络的前 3 个输出将是第一个的 Q 值 agent 和另外 2 个将是 agent 2 的 Q 值。我的奖励 函数将始终基于全局结果,每个代理都会 没有具体的奖励。
有可能吗?因为我没有找到任何关于这个的话题。 如果您需要更高的精度,请询问。
我也知道一个可能的解决方案应该是创建一个具有 3 * 2 输出的网络,每个输出将是几个动作(每个代理 1 个动作),但我真的想知道是否有人已经做了类似的事情我之前解释过,或者只是如果有人知道那行不通以及为什么。
【问题讨论】:
标签: tensorflow neural-network reinforcement-learning q-learning