【问题标题】:Cross-validation of a stack of classifiers without data shuffle returns garbage没有数据混洗的分类器堆栈的交叉验证返回垃圾
【发布时间】:2019-05-06 03:18:04
【问题描述】:

作为How to compose sklearn estimators using another estimator? 的后续行动, 我正在尝试交叉验证一堆模型。

手册

首先,我手动执行所有步骤以确保一切按预期工作:

from sklearn.datasets import make_classification
from sklearn.linear_model import LogisticRegression
from sklearn.ensemble import RandomForestClassifier, GradientBoostingClassifier
from sklearn.naive_bayes import GaussianNB
from sklearn.metrics import roc_auc_score

X, y = make_classification(n_samples=10000, n_features=40,
                           n_clusters_per_class=10,
                           n_informative=25,
                           random_state=12, shuffle=False)

logit = LogisticRegression(solver="saga",random_state=12).fit(X,y)
logit_yhat = logit.predict_proba(X)[:,1]
print("logit",roc_auc_score(y, logit_yhat))
randf = RandomForestClassifier(n_estimators=10,max_depth=5,min_samples_split=10, random_state=12).fit(X,y)
randf_yhat = randf.predict_proba(X)[:,1]
print("randf",roc_auc_score(y, randf_yhat))
gaunb = GaussianNB().fit(X,y)
gaunb_yhat = gaunb.predict_proba(X)[:,1]
print("gaunb",roc_auc_score(y, gaunb_yhat))
gbcdt = GradientBoostingClassifier(random_state=12).fit(X,y)
gbcdt_yhat = gbcdt.predict_proba(X)[:,1]
print("gbcdt",roc_auc_score(y, gbcdt_yhat))

scores = np.transpose(np.array((logit_yhat, randf_yhat, gaunb_yhat, gbcdt_yhat)))
aggregator = LogisticRegression(solver="saga",random_state=12).fit(scores, y)
aggregator_yhat = aggregator.predict_proba(scores)[:,1]
print("aggregator",aggregator.coef_,roc_auc_score(y, aggregator_yhat))

打印出来:

logit 0.6913163859713081
randf 0.7871255096874669
gaunb 0.7032834038916749
gbcdt 0.8527915275109933
aggregator [[-3.95961856  5.70858186 -2.45036885 13.3983472 ]] 0.8799606190093959

到目前为止一切顺利。

使用管道

现在我创建一个管道并检查它是否执行相同的操作:

from sklearn.base import BaseEstimator, TransformerMixin, clone
class PredictProbaTransformer(BaseEstimator, TransformerMixin):
    def __init__(self, clf):
        self.clf = clf

    def transform(self, X):
        "Return predict_proba(X)."
        print("transform")
        return self.clf.predict_proba(X)[:,[1]]

    def fit_transform(self, X, y=None, **fit_params):
        print("fit_transform")
        return self.clf.fit(X, y, **fit_params).predict_proba(X)[:,[1]]

from sklearn.pipeline import Pipeline, FeatureUnion
pipe = Pipeline([("stack",FeatureUnion([
    ("logit",PredictProbaTransformer(clone(logit))),
    ("randf",PredictProbaTransformer(clone(randf))),
    ("gaunb",PredictProbaTransformer(clone(gaunb))),
    ("gbcdt",PredictProbaTransformer(clone(gbcdt))),
])), ("aggregator",LogisticRegression(solver="saga",random_state=12))]).fit(X,y)
pipe_yhat = pipe.predict_proba(X)[:,1]
print("pipe",pipe.named_steps["aggregator"].coef_,roc_auc_score(y, pipe_yhat))

打印出来:

pipe [[-3.95961856  5.70858186 -2.45036885 13.3983472 ]] 0.8799606190093959

与“手册”部分中的 aggregator 行相同 - 很好!

交叉验证

当我尝试交叉验证 pipe 时,我感到有些奇怪:

from sklearn.model_selection import cross_validate
pipe_scores = pd.DataFrame(cross_validate(
    pipe, X=X, y=y, return_train_score=True, cv=10, scoring="roc_auc"))

打印 10 次(因为 cv=10)这 12 行:

fit_transform --- 4 times
transform     --- 8 times

因为它在每个训练阶段对stack 中的4 个分类器调用fit_transform 4 次),然后对测试 数据中相同的4 个分类器调用transform 4 次,然后again 在训练数据上再重复 4 次(即使它已经在训练阶段这样做了)。

最重要的:pipe_scores.describe()是

        fit_time  score_time  test_score  train_score
count  10.000000   10.000000   10.000000    10.000000
mean    3.329516    0.006074    0.482034     0.895046
std     0.068609    0.000594    0.081499     0.006657
min     3.212703    0.005362    0.299673     0.886333
25%     3.276795    0.005602    0.451310     0.891166
50%     3.350762    0.006122    0.504630     0.892991
75%     3.370433    0.006331    0.519399     0.898570
max     3.425937    0.007302    0.586310     0.906820

奇怪的是,所有train_scores 都超过了我在我的 手动运行。

但是,为什么test_scores 看起来是完全随机的?! (平均值和中位数约为 50%,对应于“抛硬币”分类器)。

避免这种奇怪现象的解决方法是随机排列行

那么分数就是

        fit_time  score_time  test_score  train_score
count  10.000000   10.000000   10.000000    10.000000
mean    3.400829    0.005355    0.774932     0.887762
std     0.125579    0.000444    0.011324     0.003578
min     3.211147    0.004896    0.763047     0.883219
25%     3.333121    0.005074    0.767166     0.884810
50%     3.376660    0.005153    0.772864     0.886907
75%     3.484209    0.005516    0.781219     0.890338
max     3.602676    0.006194    0.799907     0.893941

附言。 shuffle 在make_classification 中影响两个 列和 行,而在StratifiedKFold 中它只影响行,而不影响列时间>。 只有 row 洗牌很重要:如果我将列洗牌

X = X[:, np.random.permutation(X.shape[1])]

在make_classification(... shuffle=False) 之后,我得到相同的GaussianNB 和GradientBoostingClassifier 和难以察觉的不同LogisticRegression 和RandomForestClassifier,而cross_validate 返回随机 test_scores。

【问题讨论】:

  • 至于为什么会打印transform 8 times,见my answer here and specifically the comments。对于测试成绩,在上述所有示例中(没有交叉验证),您正在对相同的数据(X、y)进行训练和评分。在交叉验证训练和测试数据是不同的。尝试为您的上层代码使用不同的训练测试数据。也许尝试调整超参数
  • @VivekKumar:感谢您的链接。当我手动调用KFold 时,我得到了相同的结果,我不认为你对test_scores 的解释站得住脚(但我可能会误解你)。
  • 我不确定"When I call KFold manually, I get the same results"。你在测试折叠上也得到相同的结果(大约 88%)吗?你能显示那个代码吗?
  • @VivekKumar:是的,for train_index, test_index in skf.split(X, y): ... 的test 和train 的结果与cross_validate 相同。

标签: python scikit-learn cross-validation


【解决方案1】:

至于为什么所有train_scores 都在 88% 以上,这是因为在交叉验证时,你训练了 0.9 个训练数据。因此,您的模型可以(过度)更好地适应这些数据。至于为什么test_score 在你不打乱特征时如此之小,我相信这是因为当没有打乱的交叉验证时,训练数据集(即所有数据的 0.9)中并非所有(10 个)集群都存在于数据集他们也没有洗牌。

【讨论】:

  • train_scores 听起来很合理,test_score 不太可能——它们完全是随机的。改组如何对行为产生如此巨大的影响?!
  • 那是因为shuffle 涉及洗牌特征而不是make_classification 中的样本。这就是为什么它可能会产生如此巨大的影响。 RandomForestClassifier 和 GradientBoostingClassifier 等模型对特征的顺序非常敏感。
  • 抱歉,已修正答案。 GradientBoostingClassifier 实际上试图选择最好的拆分,因此不依赖于他们的顺序。
  • 确实,减少n_clusters_per_class 并增加cv 会导致合理的test_score 。谢谢!
猜你喜欢
  • 2013-12-30
  • 2018-09-07
  • 1970-01-01
  • 2012-09-30
  • 2015-07-06
  • 2016-03-10
  • 2014-06-04
  • 1970-01-01
  • 2017-03-15
相关资源
最近更新 更多