【发布时间】:2012-12-31 01:27:08
【问题描述】:
我正在进行文本分类,并将处理我的训练数据中未捕获的单词,这意味着该单词应被视为未知。
有谁知道如果训练数据中不存在特定单词,scikit 的交叉验证是否会将其视为不可见?
或者 scikit 是否会将所有单词都视为特征,即使它不在训练集中?
【问题讨论】:
标签: machine-learning classification scikit-learn document-classification
我正在进行文本分类,并将处理我的训练数据中未捕获的单词,这意味着该单词应被视为未知。
有谁知道如果训练数据中不存在特定单词,scikit 的交叉验证是否会将其视为不可见?
或者 scikit 是否会将所有单词都视为特征,即使它不在训练集中?
【问题讨论】:
标签: machine-learning classification scikit-learn document-classification
如果您在包含特征提取器(例如 CountVectorizer 或 TfidfVectorizer)和分类器的管道上进行交叉验证,那么一切都会自动开箱即用:仅在 train中出现的特征> test 集将被忽略(未映射到向量表示中的维度)。
在documentation on text feature extraction 中有更多关于如何使用vocabulary_ 属性将特征名称映射到维度的详细信息。
还有一个例子显示how to cross validate a pipeline that comprise a feature extraction component and a classifier。
编辑:修正火车/测试错字
编辑 2:修复了示例的断开链接。
【讨论】: