【发布时间】:2018-04-09 08:25:36
【问题描述】:
我想了解深度强化算法的工作原理以及针对任何给定环境进行自我训练所需的时间。 我想出了一个非常简单的环境示例:
有一个计数器保存 0 到 100 之间的整数。 数到100是它的目标。
有一个参数direction,其值可以是+1 或-1。
它只是显示移动的方向。
out 神经网络将此方向作为输入,将 2 个可能的动作作为输出。
- 改变方向
- 不要改变方向
第一个动作只会翻转方向(+1 => -1 或 -1 =>+1)。第二个动作将保持方向不变。
我将 python 用于后端,将 javascript 用于前端。 这似乎花费了太多时间,而且仍然很随机。我使用了 4 层感知器。 0.001 的训练率。批量 100 的记忆学习。代码是 Udemy 的人工智能教程,并且工作正常。
我的问题是,完成和每个状态的奖励应该是什么?以及训练这样一个简单的例子需要多少时间?
【问题讨论】:
标签: machine-learning neural-network artificial-intelligence reinforcement-learning pytorch