【发布时间】:2018-04-03 22:32:54
【问题描述】:
为了构建分类模型,我试图从数据集中选择最重要的特征。
我的数据包含混合属性(数字和分类)。
在应用随机森林从数据中选择特征以提高模型的准确性之后,我计划在 R 中应用 (importance or varImp) 函数。
我的问题是:我可以直接在数据上应用随机森林而无需转换步骤,或者我必须将分类属性转换为二进制 (0,1)
我在数值数据集上应用了具有重要性/varImp 函数的随机森林,模型运行良好,但我不确定混合数据。
【问题讨论】:
-
首先,由于变量重要性衡量的是删除一列后准确性的下降,所以应该没问题。到目前为止你试过了吗?你有什么问题吗? Q 可能会被标记为离题...
-
我只对数字数据集应用了随机森林。我想提高模型的准确性,所以我在 R 中应用了重要性函数来选择最重要的特征,准确性正在提高,现在我要对混合数据应用相同的方法,我需要知道我是否可以应用它直接(不将数据从类型转换为另一种类型)或不
-
我认为是的,因为 VI 度量不受数据类型的影响。
标签: r types classification random-forest