【问题标题】:Reinforcement learning with new actions/expanding actionset使用新动作/扩展动作集进行强化学习
【发布时间】:2018-07-25 23:35:42
【问题描述】:

我想知道是否有任何关于新动作的 RL 问题的研究,即考虑一个视频游戏,随着游戏的进行,代理学习更多的技能/动作,因此有更多可用的动作可供选择,因此动作集随着时间的推移而扩大。一个相关的问题

State dependent action set in reinforcement learning

但是这个问题也没有足够的答案。谢谢!

【问题讨论】:

    标签: reinforcement-learning


    【解决方案1】:

    深度强化学习的所有近期研究和论文都使用具有少量静态潜在动作的环境。但是,您可以尝试通过多种方式来弥补动作空间的可变性。

    假设我们有一个游戏环境,其中代理可以执行不同的攻击。其中一种攻击,火球,只是在游戏后期才解锁。也许你必须做一些特别的事情来解锁这个攻击,但是为了这个论证的目的,让我们假设你的代理会在游戏过程中的某个时间点解锁这个能力。

    1. 您可以将未锁定的操作添加到操作空间并分配一个 如果代理尝试采取具有 尚未解锁。因此,如果您的代理尝试使用火球并且它 尚未解锁,他们获得负奖励。然而,这 代理“学习”从不使用 火球,即使它已解锁。
    2. 您还可以通过添加新操作来改变操作空间,因为它们 变得可用。在这种情况下,代理将没有 火球攻击在他们的行动空间,直到它被解锁。你会 必须改变你的 epsilon(随机动作率)才能做更多 将新动作添加到动作空间时进行探索。
    3. 您可以将代理的可用操作作为“状态”的一部分进行跟踪。 如果代理人有能力在某一部分使用火球 游戏,但不是游戏的另一部分,可以被认为是 不同的状态,这可能会通知代理。表示状态的向量对于每个不同的可解锁能力都可以有一个二进制值,结合上述 #1 中提到的方法,您的代理可以学习有效地使用已解锁的能力。

    This research paper 讨论了连续 动作空间中的强化学习,这并不完全相同,但可能会给您一些额外的想法。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-03-31
      • 1970-01-01
      • 1970-01-01
      • 2019-05-31
      • 1970-01-01
      • 2019-11-22
      相关资源
      最近更新 更多