【发布时间】:2021-10-16 22:43:21
【问题描述】:
我正在研究一个包含 100 万个数据集的二元分类问题。数据集有 84 个特征和两个目标变量 'Normal 和 Bad' 编码后为 0 和 1。
没有任何特征选择,我得到了 99.99900001,实际上,我不能相信这个分数。 我已经完成了 n_splits=10 拆分的 StratifiedKFold,我得到了 92.92%,但我需要超过 97%。当我改变 n_splits=30 时,我得到了 98% 的准确率。
n_splits=30 是否适用于 100 万个数据集,我也可以使用 n_splits=30 吗?谢谢。
这里是获得 99.999 准确率的示例代码
from sklearn.tree import DecisionTreeClassifier
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X,
y,test_size=0.30, random_state=4)
model = DecisionTreeClassifier()
model.fit(X_train, y_train)
result = model.score(X_test, y_test)
print('Accuracy: ',(result)*100)
【问题讨论】:
标签: python decision-tree