【发布时间】:2022-07-18 19:14:52
【问题描述】:
我正在为 RL 使用 SB3 包,并且正在尝试 model.learn() 函数。
我不完全了解 model.learn() 参数在它们如何协同工作以及与我的环境中的作用。
我的 RL 使用表格数据集工作,因此可能的时间步数存在固有限制。
假设这些是我的条件:
- 我有一个包含 20,000 行的数据集(可能的时间步长)
- 在我的环境中,我的 step() 函数包含一个 if 语句,当执行的步数达到 1,000 时,它会将“done”翻转为 True(step() 函数计算自初始化以来它被调用的次数)环境)。
- 我以 total_timesteps = 30,000 运行 model.learn()。
我这样做时没有遇到任何错误。有人可以解释发生了什么吗? model.learn() 是否在前 1,000 个时间步中运行我的环境,然后重新启动并继续以这种方式循环,直到总时间步达到 30,000 个?
如果是这样,num_eval_episodes 是如何参与其中的?它会改变函数的运行方式吗?如果有,怎么做?
对于分散的问题,我很抱歉,感谢您的澄清。
【问题讨论】:
标签: reinforcement-learning stable-baselines