【发布时间】:2019-08-30 13:19:03
【问题描述】:
我正在使用 sklearn 运行 LinearSVC 模型来解决我在不平衡数据集上的分类问题,并得到如下结果:
confusion matrix:
[[43677 28222]
[ 5309 9575]]
classification report:
precision recall f1-score support
class 0: 0.72 0.69 0.71 133958
class 1: 0.70 0.73 0.72 133958
micro avg 0.71 0.71 0.71 267916
macro avg 0.71 0.71 0.71 267916
weighted avg 0.71 0.71 0.71 267916
precision recall f1-score support
class 0: 0.89 0.61 0.72 71899
class 1: 0.25 0.64 0.36 14884
micro avg 0.61 0.61 0.61 86783
macro avg 0.57 0.63 0.54 86783
weighted avg 0.78 0.61 0.66 86783
看看结果,你对我有什么改进的建议吗? (我正在使用过采样的方法来平衡训练数据集)
我关心的是从数据中过滤掉第 1 类中的所有实例,我应该只看第 1 类的精度/召回率,还是应该使用任何其他指标来评估我的模型有多好?
【问题讨论】:
-
class_weightfrom scikit-learn.org/stable/modules/generated/… 有和没有过采样应该是首先要尝试的事情之一。
标签: scikit-learn svm