【发布时间】:2015-09-07 09:43:57
【问题描述】:
抱歉,如果这很明显,但我找不到明确的答案:
假设我使用了一个非常典型的管道:
feat_sel = RandomizedLogisticRegression()
clf = RandomForestClassifier()
pl = Pipeline([ ('preprocessing', preprocessing.StandardScaler()),
('feature_selection', feat_sel),
('classification', clf)])
pl.fit(X,y)
现在当我将 pl 应用到一个新集合时,
pl.predict(X_classify);
是要重新应用 RandomizedLogisticRegression,还是要在新数据中使用在训练中选择的列?如果没有,管道是否有办法区分特征选择器和特征提取器/缩放器/其他应应用于新输入的转换?在我确定之前,我会跳过管道功能,只是手动执行每个步骤并维护状态。
谢谢!
【问题讨论】:
标签: python scikit-learn pipeline feature-selection