【发布时间】:2018-07-07 00:34:56
【问题描述】:
我正在尝试为各种有 5 个关卡的游戏创建基准。目标是先训练一个模型在 3 个级别上收敛,然后在其余 2 个级别上测量学习曲线。
对于如何在多个级别上训练模型是否有一般规则?培训应该一个接一个地进行吗?
非常感谢您的帮助。
【问题讨论】:
标签: deep-learning reinforcement-learning
我正在尝试为各种有 5 个关卡的游戏创建基准。目标是先训练一个模型在 3 个级别上收敛,然后在其余 2 个级别上测量学习曲线。
对于如何在多个级别上训练模型是否有一般规则?培训应该一个接一个地进行吗?
非常感谢您的帮助。
【问题讨论】:
标签: deep-learning reinforcement-learning
假设您总共可以训练N 级别(在您可能有的时间限制内)。
我不推荐以下设置:
N / 3次N / 3次N / 3次这种设置的风险在于,您首先学会在第一级打得很好,然后忘记所学的一切并“过度拟合”到第二级,然后再次忘记并过度拟合到第三级。
您需要确保在整个训练过程中始终保持良好的级别组合,因为最终目标是在(不可见的)级别 4 和 5 上泛化并表现良好。
为此,我推荐以下设置之一:
N 次或者:
N 次训练。使用更复杂的策略可能会做得更好。例如,您可以尝试在过去X 次您玩过一个关卡时跟踪每个关卡的平均表现,并优先考虑您表现不佳的关卡(因为显然您在这些关卡中还有很多东西要学习)。例如,这可以通过诸如 UCB1 之类的多臂强盗策略来完成,在这种策略中,您可以使用近期的负面表现作为“奖励”。
可能还值得研究通用视频游戏 AI 竞赛的学习赛道 (http://gvgai.net/)。我相信比赛正是你提到的三个训练级别加上每场比赛两个级别进行评估的设置(也许这甚至是你的问题的来源?)。如果源代码可用,您可以查看本次比赛的各个参与者在做什么,和/或查找有关比赛/参赛作品的文献。
【讨论】: