【发布时间】:2018-06-01 20:16:06
【问题描述】:
我正在使用nltk 和sklearn 构建一个基本的NLP 程序。我在数据库中有一个大型数据集,我想知道训练分类器的最佳方法是什么。
是否建议以块的形式下载训练数据并将每个块传递给分类器?这是否可能,或者我会覆盖从前一个块中学到的东西?
from nltk.classify.scikitlearn import SklearnClassifier
from sklearn.naive_bayes import MultinomialNB
while True:
training_set, proceed = download_chunk() # pseudo
trained = SklearnClassifier(MultinomialNB()).train(training_set)
if not proceed:
break
这通常是如何完成的?我想避免让数据库连接保持打开太久。
【问题讨论】:
标签: python scikit-learn nlp nltk training-data