【发布时间】:2014-07-07 19:05:47
【问题描述】:
我有一组特征是手工挑选的。并非所有这些都是单个单词;其中一些是二元组,另一些是三元组。我想对我的文本进行建模——这些文本以基于这些特征的原始文本的形式提供。我怎么能在sklearn中做到这一点?到目前为止,这就是我定义 Vectorizer 的方式。
def initialize():
from sklearn.feature_extraction.text import CountVectorizer
vectorizer = CountVectorizer(ngram_range=(1, 3))
return vectorizer
【问题讨论】:
标签: python scikit-learn vectorization