【发布时间】:2016-12-06 03:51:00
【问题描述】:
我最近在练习bag of words introduction : kaggle,我想澄清一些事情:
使用vectorizer.fit_transform( " * on the list of *cleaned* reviews* " )
现在,当我们在火车评论中准备词袋数组时,我们在火车评论列表中使用了fit_predict,现在我知道fit_predict 做了两件事,首先它适合数据并知道 词汇表,然后在每条评论上制作向量。
因此,当我们使用 vectorizer.transform( "*list of cleaned train reviews* " ) 时,这只是将测试评论列表转换为每个评论的向量。
我的问题是,为什么不在测试列表中也使用fit_transform?我的意思是在文档中说它会导致过度拟合,但无论如何使用它对我来说确实有意义;让我给你我的前景:
当我们不使用fit_transform 时,我们实质上是在使用火车评论中最常见的词来制作测试评论的特征向量。为什么不使用测试本身中最常用的词来制作测试特征数组?
我的意思是随机森林关心吗?如果我们给随机森林训练特征数组和训练特征情感来工作和训练自己,然后给它测试 特征数组会'它只是给出对情绪的预测吗?
【问题讨论】:
标签: python scikit-learn tokenize text-processing