【发布时间】:2015-03-14 17:39:54
【问题描述】:
我正在使用 SVC 对一些文本进行分类,并且我想运行网格搜索,因此我按照documentation 提供的示例进行操作。在示例中,他们使用带有以下参数的 SGDClassifier:
parameters = {
'vect__max_df': (0.5, 0.75, 1.0),
#'vect__max_features': (None, 5000, 10000, 50000),
'vect__ngram_range': ((1, 1), (1, 2)), # unigrams or bigrams
#'tfidf__use_idf': (True, False),
#'tfidf__norm': ('l1', 'l2'),
'clf__alpha': (0.00001, 0.000001),
'clf__penalty': ('l2', 'elasticnet'),
#'clf__n_iter': (10, 50, 80),
}
我的问题是,我应该为 SVC 分类器、tfidf、散列向量器和 CountVectorizer 尝试什么样的参数?如果这是一个多类分类问题,我应该如何选择这个参数?
【问题讨论】:
标签: python machine-learning nlp scikit-learn