【发布时间】:2016-09-25 20:18:10
【问题描述】:
我目前正在研究一个相当简单的情绪分类程序。在训练阶段一切正常。但是,我在使用 CountVectorizer 测试包含看不见的单词的新文本字符串时遇到了问题。
出于这个原因,我正在尝试在测试阶段编写一个用于矢量化的查找词汇表。但是,我不知道如何创建和检索要作为参数传递的词汇对象。
我的两种方法目前出现如下:
def trainingVectorTransformation (messages):
#--> ReviewText to vectors
vect = CountVectorizer(analyzer=split_into_lemmas).fit(messages['reviewText'])
messages_bow = vect.transform(messages['reviewText'])
feature_list = vect.get_feature_names()
#NOT SURE HOW TO CREATE VOCABULARY
with open("vocab.txt", "w") as text_file:
text_file.write(str(feature_list))
tfidf_transformer = TfidfTransformer().fit(messages_bow)
messages_tfidf = tfidf_transformer.transform(messages_bow)
return messages_tfidf
和
def testingVectorTransformation (messages):
#--> ReviewText to vectors
#NOT SURE HOW TO READ THE CREATED VOCABULARY AND USE IT APPROPRIATELY
txt = open("vocab.txt")
vocabulary = txt.read()
vect = CountVectorizer(analyzer=split_into_lemmas, vocabulary = vocabulary).fit(messages['reviewText'])
messages_bow = vect.transform(messages['reviewText'])
tfidf_transformer = TfidfTransformer().fit(messages_bow)
messages_tfidf = tfidf_transformer.transform(messages_bow)
return messages_tfidf
如果有人对如何正确创建和使用词汇有任何建议,我将不胜感激。
【问题讨论】:
标签: python machine-learning scikit-learn vectorization sentiment-analysis