【发布时间】:2018-03-14 06:09:22
【问题描述】:
我的数据集形状为2300 x 35 加上目标变量。
我所有的列都是object dtype,它包括数字和分类值,所以我在整个数据集上运行labelencoding。所以,我不确定这是否会成为问题。
我运行了Logistic Regression,准确率达到了 99%。这怎么可能?我可能做错了什么?
(目标列从训练和测试集中移除)
只有当我将训练数据减少到 5% 以下时,准确性才会下降,不知道发生了什么。
【问题讨论】:
-
数据集是否不平衡?
-
是的,但我添加了
class_weights属性 -
这在训练而不是测试期间会有所不同。尝试改用 f1-score
-
我所有的分数都是
1.0或0.99。我什至从较高的班级中手动随机选择相同数量的样本来平衡班级。 -
会不会是我的标签编码问题?因为它也给整数标签。
标签: python machine-learning logistic-regression