【问题标题】:Convergence of value iteration价值迭代的收敛
【发布时间】:2013-11-11 01:16:01
【问题描述】:

为什么值迭代算法的终止条件 (例如http://aima-java.googlecode.com/svn/trunk/aima-core/src/main/java/aima/core/probability/mdp/search/ValueIteration.java

在MDP(马尔可夫决策过程)中是

||Ui+1-Ui||

Ui 是实用程序的向量
Ui+1 更新的实用程序向量

error - 算法中使用的错误界限

算法中使用的伽马折扣因子

“error*(1-gamma)/gamma”从何而来? “除以伽玛”是因为每一步都被伽玛打折吗? 但是错误*(1-伽玛)? 错误必须有多大?

【问题讨论】:

  • 你能再解释一下,特别是“什么是 MDP?”和“你的参数是什么(Ui、gamma、error 等)?”

标签: algorithm artificial-intelligence iteration markov-chains convergence


【解决方案1】:

这称为贝尔曼误差或贝尔曼残差。

请参阅 Williams and Baird,1993 年以用于 MDP。

请参阅Littman,1994 年以用于 POMDP。

【讨论】:

  • 我没有看到任何关于 error*(1-gamma)/gamma 终止条件的引用。
  • 利特曼定理三;取自 Williams 和 Baird 的性能界限部分。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2015-09-14
  • 1970-01-01
  • 2019-06-26
  • 2019-03-12
  • 2019-03-11
  • 1970-01-01
  • 2017-09-29
相关资源
最近更新 更多