【发布时间】:2019-02-18 13:01:33
【问题描述】:
我使用朴素贝叶斯进行文本分类,我有 100k 条记录,其中 88k 是正类记录,12k 条记录是负类记录。我使用 countvectorizer 将句子转换为 unigrams 和 bigrams,并从 [0,10] 中获取 50 个值的 alpha 范围,然后绘制绘图。
在拉普拉斯加性平滑中,如果我不断增加 alpha 值,那么交叉验证数据集的准确度也会增加。我的问题是这种趋势是否可以预料?
【问题讨论】:
-
同时使用RandomizedSearchCV 和GridSearchCV 首先使用RandomizedSearchCV,然后使用GridSearchCV。这样
alpha将被更准确地超调。还可以尝试从 1e-4 到 1e3 的各种 alpha 值 -
是的,我使用了 GridSearchCV,但准确率随着 alpha 的增加而不断增加
标签: machine-learning data-mining cross-validation naivebayes hyperparameters