【发布时间】:2018-09-16 11:42:32
【问题描述】:
我正在分析成绩数据。作为一种查看数据的新方法,我第一次使用决策树。我相信我有正确的代码,现在我正在尝试解释它。特征是一系列测验的成绩,分类是学生获得的最终成绩。我有几个问题:
如果我的理解是正确的,每个节点都有一个测试和一个左分支,表示测试为真,另一个为假。当这棵树似乎已经问了足够多的问题时,它就会说出“类”是什么。如果是这样的话,为什么在叶子之前的盒子上有一个 class=?我还以为只是叶子有class=
如何“调整”整个树?好像箱子太多了。这是“过度拟合”的一个例子吗?我怎样才能更好地调整它?
例如,FINAL_GRADE_PA01 的使用似乎是基于数据的排序任意的。这是真的还是分析实际上得出的结论是该特征是最好的鉴别器?
【问题讨论】:
-
您好。社区在帖子中讨论了礼貌和细节,并决定我们宁愿追求简洁和技术标准的写作。因此,请不要在帖子中添加感谢、问候、问候等内容。 Reference is here 在元上。
-
干得好@halfer :)
标签: machine-learning scikit-learn decision-tree