【发布时间】:2018-01-08 16:31:33
【问题描述】:
我正在使用 Scikit Learn 的决策树对数据集进行回归。
我得到了非常好的结果,但我担心的一个问题是许多功能的相对不确定性非常高。
我尝试只删除具有高不确定性的案例,但这会显着降低模型的性能。
特征本身是通过实验确定的,因此它们具有相关的实验不确定性。数据本身没有噪音。
所以我的问题是,有没有一种将与特征相关的不确定性纳入机器学习算法的好方法?
感谢大家的帮助!
【问题讨论】:
-
对不确定的特征添加随机噪声,对每个变异数据集做回归,计算回归参数的统计量?
-
您能否详细说明“许多功能的相对不确定性非常高”?例如,您是否期望输入数据中有很多噪音?如果是这种情况,您可以尝试许多消除/减少/调节噪音的策略。
-
特征本身是通过实验确定的,因此它们具有相关的实验不确定性。数据本身没有噪音。
标签: python python-3.x machine-learning regression decision-tree