【发布时间】:2016-06-09 14:23:38
【问题描述】:
在一个完美的信息环境中,我们能够知道一个动作后的状态,比如下棋,有什么理由使用 Q 学习而不是 TD(时间差)学习?
据我了解,TD learning 会尝试学习 V(state) value,但 Q learning 会学习 Q(state action value) value,这意味着 Q learning 学习速度较慢(因为状态动作组合不仅仅是状态),对吗?
【问题讨论】:
-
TD学习是指一组算法,其中Q学习就是一个例子。
标签: machine-learning reinforcement-learning q-learning temporal-difference