【发布时间】:2015-02-24 17:36:36
【问题描述】:
我想用 scikit 向量化一个有列表的列表。我去了我阅读培训文本的路径,然后我得到了这样的东西:
corpus = [["this is spam, 'SPAM'"],["this is ham, 'HAM'"],["this is nothing, 'NOTHING'"]]
from sklearn.feature_extraction.text import CountVectorizer
vect = CountVectorizer(analyzer='word')
vect_representation= vect.fit_transform(corpus)
print vect_representation.toarray()
我得到以下信息:
return lambda x: strip_accents(x.lower())
AttributeError: 'list' object has no attribute 'lower'
还有一个问题是每个文档末尾的标签,我应该如何处理它们才能进行正确的分类?
【问题讨论】:
-
刚刚阅读您的帖子,因为我遇到了类似的问题。我的错误是:corpus 不应该是一个列表,它应该是一个字符串列表,像这样:corpus = ["this is spam","this is ham",...]
标签: python machine-learning nlp scikit-learn