【发布时间】:2016-08-26 06:12:26
【问题描述】:
在为整个数据集训练分类器时出现内存错误,因此我将数据集分成小部分并为每个部分训练一个单独的分类器对象。
为了测试,我需要这些单独的分类器对象的组合。那我该怎么做。我可以将对象存储在 pickle 文件中,但它们也只是单独的对象。
我正在使用 NLTK。
代码:
documents = [(list(movie_reviews.words(fileid)), category)
for category in movie_reviews.categories()
for fileid in movie_reviews.fileids(category)]
all_words = []
for w in movie_reviews.words():
all_words.append(w.lower())
all_words = nltk.FreqDist(all_words)
word_features = list(all_words.keys())[:3000]
def find_features(document):
words = set(document)
features = {}
for w in word_features:
features[w] = (w in words)
return features
#print((find_features(movie_reviews.words('neg/cv000_29416.txt'))))
featuresets = [(find_features(rev), category) for (rev, category) in documents]
numtrain = int(len(documents) * 90 / 100)
training_set = featuresets[:numtrain]
testing_set = featuresets[numtrain:]
classifier = nltk.NaiveBayesClassifier.train(training_set)
【问题讨论】: