【发布时间】:2016-10-27 20:48:22
【问题描述】:
我有同样的问题,在here 中提出过:
我有一个关于在sklearn 的文本分类中使用交叉验证的问题。在交叉验证之前对所有数据进行向量化是有问题的,因为分类器会“看到”测试数据中出现的词汇。 Weka 有过滤分类器来解决这个问题。此函数的 sklearn 等效项是什么?我的意思是对于每个折叠,特征集都会不同,因为训练数据不同。
但是,因为我在分类步骤和分类步骤之间对数据进行了大量处理,所以我不能使用管道......并且试图通过我自己实现交叉验证作为整个过程的外循环...任何关于这方面的指导,因为我对python和sickitlearn都很陌生
【问题讨论】:
标签: python scikit-learn cross-validation