【问题标题】:SKLearn Cross-validation:SKLearn 交叉验证:
【发布时间】:2012-12-31 01:27:08
【问题描述】:

我正在进行文本分类,并将处理我的训练数据中未捕获的单词,这意味着该单词应被视为未知。

有谁知道如果训练数据中不存在特定单词,scikit 的交叉验证是否会将其视为不可见?

或者 scikit 是否会将所有单词都视为特征,即使它不在训练集中?

【问题讨论】:

    标签: machine-learning classification scikit-learn document-classification


    【解决方案1】:

    如果您在包含特征提取器(例如 CountVectorizer 或 TfidfVectorizer)和分类器的管道上进行交叉验证,那么一切都会自动开箱即用:仅在 train中出现的特征> test 集将被忽略(未映射到向量表示中的维度)。

    documentation on text feature extraction 中有更多关于如何使用vocabulary_ 属性将特征名称映射到维度的详细信息。

    还有一个例子显示how to cross validate a pipeline that comprise a feature extraction component and a classifier

    编辑:修正火车/测试错字

    编辑 2:修复了示例的断开链接。

    【讨论】:

    猜你喜欢
    • 2018-08-16
    • 2018-04-26
    • 1970-01-01
    • 2015-06-11
    • 2021-03-25
    • 2017-03-15
    • 2016-05-07
    • 2021-11-24
    • 2014-07-27
    相关资源
    最近更新 更多