【发布时间】:2014-05-05 12:43:51
【问题描述】:
我有一个关于在 sklearn 的文本分类中使用交叉验证的问题。在交叉验证之前对所有数据进行向量化是有问题的,因为分类器会“看到”测试数据中出现的词汇。 Weka 有过滤分类器来解决这个问题。此功能的 sklearn 等效项是什么?我的意思是对于每个折叠,特征集都会不同,因为训练数据不同。
【问题讨论】:
-
我认为这个问题在名为“Cross Validated”的 Stack Exchange 机器学习和统计网站上可能会有更好的接受度。
-
这个问题似乎是题外话,因为它属于stats.stackexchange.com
-
澄清:这不是题外话,因为这个问题特别针对 CV 用于 sklearn 中的文本分类。数值数据不会有这个问题,因为特征集对于任何折叠都是固定的,但对于文本分类中的每个折叠来说都是不同的。
标签: scikit-learn