【发布时间】:2016-07-30 08:28:40
【问题描述】:
我的数据集有两个类。非兴趣类占90%,兴趣类占10%左右。
我已经完成了重采样,不仅是一次,而且是一组平衡的集合(例如 10 组)。并进行多数投票以获得最终的预测结果。在比较了许多模型之后,树给出了最好的结果。而且我已经根据重要性分数挑选出了最重要的特征。
整体准确率还不错,75%,但是对我感兴趣的类的准确率只有30%,不好。如何对目标类的精度进行优化?我认为 R 中 ctree 包背后的算法是对整体准确性进行优化。我也尝试过一类分类,比如svm,但效果不好。顺便说一句,我同时使用了 R 和 python。但我没有找到任何关于我的问题的相关包。我是否需要编写自己的树算法来优化感兴趣的类的精度?谢谢。
【问题讨论】:
标签: optimization machine-learning classification resampling