【发布时间】:2019-10-14 03:12:30
【问题描述】:
我正在尝试训练一个深度强化学习模型来完成迷宫逃逸任务,并且每次它都以一张图像作为输入(例如,不同的“迷宫”)。
假设我有大约 10K 个不同的迷宫图像,理想的情况是在训练 N 个迷宫之后,我的模型可以很好地快速解决剩下的 10K - N 个图像中的难题。
我写信是为了询问一些关于如何为训练任务选择好的 N 的好主意/经验证据。
一般来说,我应该如何估计和增强我的强化模型的“迁移学习”能力?让它更通用?
任何意见或建议将不胜感激。谢谢。
【问题讨论】:
-
你的方法我不清楚。除了迷宫的图像,你还给你的模型什么来帮助它解决逃跑任务?
-
@Neb 只是一个非常标准的
env。类似github.com/samyzaf/tdfmaze/blob/master/tdfmaze.py
标签: deep-learning reinforcement-learning transfer-learning