【问题标题】:deep reinforcement learning parameters and training time for a simple game简单游戏的深度强化学习参数和训练时间
【发布时间】:2018-04-09 08:25:36
【问题描述】:

我想了解深度强化算法的工作原理以及针对任何给定环境进行自我训练所需的时间。 我想出了一个非常简单的环境示例:

有一个计数器保存 0 到 100 之间的整数。 数到100是它的目标。

有一个参数direction,其值可以是+1 或-1。 它只是显示移动的方向。

out 神经网络将此方向作为输入,将 2 个可能的动作作为输出。

  1. 改变方向
  2. 不要改变方向

第一个动作只会翻转方向(+1 => -1 或 -1 =>+1)。第二个动作将保持方向不变。

我将 python 用于后端,将 javascript 用于前端。 这似乎花费了太多时间,而且仍然很随机。我使用了 4 层感知器。 0.001 的训练率。批量 100 的记忆学习。代码是 Udemy 的人工智能教程,并且工作正常。

我的问题是,完成和每个状态的奖励应该是什么?以及训练这样一个简单的例子需要多少时间?

【问题讨论】:

    标签: machine-learning neural-network artificial-intelligence reinforcement-learning pytorch


    【解决方案1】:

    在强化学习中,下划线的奖励函数定义了游戏。不同的奖励函数导致不同的博弈具有不同的最优策略。

    在您的情况下,有几种不同的可能性:

    1. 只有达到 100 才给 +1。
    2. 如果达到 100,则为 +1,如果不是 100,则为 -0.001。
    3. 向上 +1 -1 向下。

    第三种情况太简单了,不涉及长期计划。在第一种情况下,代理只会在意外达到 100 并认为它很好时才开始学习。但在第一种情况下,一旦它学会上升,到达那里需要多长时间并不重要。第二个是最有趣的地方,它需要尽快到达那里。

    使用什么奖励没有正确答案,但最终你选择的奖励决定了你正在玩的游戏。

    注意:这个问题的 4 层感知器是 Big Time Overkill。一层应该就够了(这个问题很简单)。您是否尝试过OpenAI's gym 的强化学习环境?强烈推荐它,他们有所有“经典”强化学习问题。

    【讨论】:

    • 感谢您对 OpenAI 健身房的建议。这是很大的帮助。
    猜你喜欢
    • 2019-10-20
    • 2023-02-01
    • 2020-11-24
    • 2021-07-22
    • 2018-11-05
    • 1970-01-01
    • 2020-11-10
    • 2020-06-30
    • 2018-11-03
    相关资源
    最近更新 更多