【问题标题】:Classification Precision Optimization towards one class?针对一类的分类精度优化?
【发布时间】:2016-07-30 08:28:40
【问题描述】:

我的数据集有两个类。非兴趣类占90%,兴趣类占10%左右。

我已经完成了重采样,不仅是一次,而且是一组平衡的集合(例如 10 组)。并进行多数投票以获得最终的预测结果。在比较了许多模型之后,树给出了最好的结果。而且我已经根据重要性分数挑选出了最重要的特征。

整体准确率还不错,75%,但是对我感兴趣的类的准确率只有30%,不好。如何对目标类的精度进行优化?我认为 R 中 ctree 包背后的算法是对整体准确性进行优化。我也尝试过一类分类,比如svm,但效果不好。顺便说一句,我同时使用了 R 和 python。但我没有找到任何关于我的问题的相关包。我是否需要编写自己的树算法来优化感兴趣的类的精度?谢谢。

【问题讨论】:

    标签: optimization machine-learning classification resampling


    【解决方案1】:

    有很多模型可以让你权重类。这通常比过采样要好,因为它直接交替目标,而不是人为地欺骗模型超重。如果您使用 python,并且像基于树的方法一样,scikit-learn 中的随机森林具有类权重功能,只要未获得所需的精度,只需超重您的少数类。

    【讨论】:

    • 但一般来说,加权类与重采样做同样的事情吗?所以我跳过过采样步骤,直接在我的不平衡数据集上构建模型,并添加权重?
    • 不,重采样偏斜,不应用于支持加权的模型。它们相似但不相同。欠采样是加权的近似值,但只是近似值。基本形式的过采样也只是粗略的近似(尤其是对于一些交互方法),并且一些过采样器通过引入人工样本来做更多的事情
    猜你喜欢
    • 2015-02-21
    • 2018-11-15
    • 2013-02-26
    • 2013-09-04
    • 2015-06-15
    • 2012-11-29
    • 2017-09-19
    • 2012-05-05
    • 2018-01-18
    相关资源
    最近更新 更多