我试图对答案进行逆向工程,如果我得到更明确的信息,我会更新这个。
我在 Toyota Corolla 数据集上运行了一棵非常小的树(预测二手车的价格)。这是树:
Age_08_04 < 32.5
| Weight < 1297.5 : 18033.54 (121/6009564.12) [59/6768951.55]
| Weight >= 1297.5 : 27945.83 (3/10945416.67) [3/22217291.67]
Age_08_04 >= 32.5
| Age_08_04 < 57.5 : 11363.26 (296/2827594.01) [144/2999066.05]
| Age_08_04 >= 57.5 : 8636.94 (537/1487597.91) [273/1821232.47]
叶节点中的第一个数字(18033、27945、11363、8636)是这些汽车的预测价格。
第二个和第四个数字加起来就是实例数:
121 + 59 + 3 + 3 ...+273 = 1436,整个集合中的实例数。
第二个数字加起来是 957(实例的三分之二),第四个数字加起来是 479(实例的三分之一)。
Witten 等人的书(数据挖掘:实用机器学习工具和技术,第 4 版),第 6.1 节(决策树:错误估计错误率)注释
“提出错误估计的一种方法是标准
验证技术:保留一些最初给出的数据
并将其用作独立的测试集来估计每个
节点。这称为减少错误修剪。”(Kindle 位置 5403)
所以我认为它对数据进行了 2/3、1/3 拆分,尽管我们也在进行 10 倍交叉验证。
第三和第五个数字(在 / 之后)似乎是 MSE。做一点代数,第五个数字的加权平均值与交叉验证总结中报告的均方根误差和相对方根误差一致。 (不太准确,但我认为我不会期望它是)
同样,如果我发现更多信息,我会更新这个答案——我很乐意从其他人那里获得更明确的信息。