【发布时间】:2016-04-11 20:55:11
【问题描述】:
我正在尝试解决类别不平衡的二元分类问题。我有一个包含 210,000 条记录的数据集,其中 92 % 是 0s 而 8% 是 1 秒。我在python 中使用sklearn (v 0.16) 为random forests。
我看到在构造分类器时有两个参数sample_weight 和class_weight。我目前正在使用参数class_weight="auto"。
我使用正确吗? class_weight 和 sample weight 实际上是做什么的,我应该使用什么?
【问题讨论】:
-
是的,我试过了,class_weight="auto",它给了我很好的精度和召回率,但我想知道幕后发生了什么,我什至做得对
标签: python scikit-learn random-forest supervised-learning