【问题标题】:Weights updating and estimating training example values in playing checks权重更新和估计下注中的训练示例值
【发布时间】:2012-09-14 17:26:57
【问题描述】:
我正在阅读 Tom Mitchell 的机器学习书,第一章。
我想做的是编写程序来和自己玩跳棋,并学会在最后获胜。我的问题是关于它遇到的非终端板位置的信用分配。也许我们可以使用其特征和随机权重的线性组合来设置值,如何使用 LMS 规则对其进行更新?因为除了结束状态,我们没有训练样本。
我不确定我是否清楚地说明了我的问题,尽管我尝试过。
【问题讨论】:
标签:
machine-learning
artificial-intelligence
【解决方案1】:
我没有读过那本具体的书,但我的方法如下。假设白方获胜。然后,白方通过的每个位置都应该得到正值,而黑方通过的每个位置都应该得到负值。如果你重复这个推理,当你有一组动作组成一个游戏时,你应该从胜利者的所有位置上添加一些分数,并从失败者的所有位置中移除一些分数。你这样做是为了一堆电脑与电脑游戏。
您现在拥有一个由一堆棋子位置和相应分数组成的数据集。您现在可以计算这些位置的特征并训练您最喜欢的回归器,例如 LMS。
这种方法的一个改进是训练回归器,然后制作更多游戏,其中每个动作都是根据该动作的预测得分随机抽取的(即导致得分较高位置的动作具有更高的概率)。然后更新这些分数并重新训练回归器等。