【发布时间】:2015-05-22 04:36:07
【问题描述】:
我是 scikit-learn 的新手,目前正在学习朴素贝叶斯(多项式)。现在,我正在对 sklearn.feature_extraction.text 中的文本进行矢量化处理,由于某种原因,当我对某些文本进行矢量化处理时,“I”这个词不会出现在输出的数组中。
代码:
x_train = ['I am a Nigerian hacker', 'I like puppies']
# convert x_train to vectorized text
vectorizer_train = CountVectorizer(min_df=0)
vectorizer_train.fit(x_train)
x_train_array = vectorizer_train.transform(x_train).toarray()
# print vectorized text, feature names
print x_train_array
print vectorizer_train.get_feature_names()
输出:
1 1 0 1 0
0 0 1 0 1
[u'am', u'hacker', u'like', u'nigerian', u'puppies']
为什么“我”似乎没有出现在功能名称中?当我将其更改为“Ia”或其他类似名称时,它会显示出来。
【问题讨论】:
标签: scikit-learn feature-extraction