【发布时间】:2016-03-22 16:40:43
【问题描述】:
我想获得一些关于如何将 Q 学习算法与函数逼近一起使用的有用说明。对于基本的 Q 学习算法,我找到了一些例子,我想我确实理解了。如果使用函数逼近,我会遇到麻烦。有人可以通过一个简短的例子来解释一下它是如何工作的吗?
我知道的:
- 我们使用特征和参数来代替使用矩阵来表示 Q 值。
- 使用 fauters 和参数的线性组合进行近似。
- 更新参数。
我已经查看了这篇论文:Q-learning with function approximation
但是我找不到任何有用的教程如何使用它。
感谢您的帮助!
【问题讨论】:
标签: algorithm reinforcement-learning q-learning function-approximation