【问题标题】:How to tell scikit-learn vectorizer use specific features?如何告诉 scikit-learn 矢量化器使用特定功能?
【发布时间】:2014-07-07 19:05:47
【问题描述】:

我有一组特征是手工挑选的。并非所有这些都是单个单词;其中一些是二元组,另一些是三元组。我想对我的文本进行建模——这些文本以基于这些特征的原始文本的形式提供。我怎么能在sklearn中做到这一点?到目前为止,这就是我定义 Vectorizer 的方式。

def initialize():
    from sklearn.feature_extraction.text import CountVectorizer
    vectorizer = CountVectorizer(ngram_range=(1, 3))
    return vectorizer

【问题讨论】:

    标签: python scikit-learn vectorization


    【解决方案1】:

    CountVectorizer 和TfIdfVectorizer 允许您指定要使用的词汇表。将它们作为关键字参数vocabulary 传递给构造函数。引用自docs:

    词汇表:映射或可迭代,可选

    无论是映射(例如,字典),其中键是术语,值是 特征矩阵中的索引,或可迭代的项。如果不 给定,从输入文档中确定一个词汇表。

    【讨论】:

      猜你喜欢
      • 2019-06-09
      • 2015-03-02
      • 1970-01-01
      • 2015-07-10
      • 1970-01-01
      • 2013-02-21
      • 2017-02-24
      • 1970-01-01
      • 2014-05-01
      相关资源
      最近更新 更多