【问题标题】:Improve result of classification problem on highly imbalanced dataset改进高度不平衡数据集上的分类问题的结果
【发布时间】:2019-08-30 13:19:03
【问题描述】:

我正在使用 sklearn 运行 LinearSVC 模型来解决我在不平衡数据集上的分类问题,并得到如下结果:

confusion matrix:
[[43677 28222]
 [ 5309  9575]]

classification report:
   precision    recall  f1-score   support

   class 0:       0.72      0.69      0.71    133958
   class 1:       0.70      0.73      0.72    133958

   micro avg       0.71      0.71      0.71    267916
   macro avg       0.71      0.71      0.71    267916
weighted avg       0.71      0.71      0.71    267916

               precision    recall  f1-score   support

class 0:       0.89      0.61      0.72     71899
class 1:       0.25      0.64      0.36     14884

    micro avg       0.61      0.61      0.61     86783
    macro avg       0.57      0.63      0.54     86783
 weighted avg       0.78      0.61      0.66     86783

看看结果,你对我有什么改进的建议吗? (我正在使用过采样的方法来平衡训练数据集)

我关心的是从数据中过滤掉第 1 类中的所有实例,我应该只看第 1 类的精度/召回率,还是应该使用任何其他指标来评估我的模型有多好?

【问题讨论】:

标签: scikit-learn svm


【解决方案1】:

过采样不会一直有帮助(即它只是复制样本以平衡数据)。 尝试不同的方法,例如“合成少数过采样技术”。 更多详情请参考以下SMOTE

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2019-12-01
    • 2018-09-13
    • 2019-07-27
    • 2021-10-01
    • 2016-01-06
    • 2020-04-12
    • 2019-11-05
    相关资源
    最近更新 更多