【发布时间】:2017-10-23 08:08:34
【问题描述】:
scikit-learn 中有许多有监督的分类器算法,但我找不到任何关于它们在大型数据集上的可扩展性的信息。我知道,例如,支持向量机在处理大型数据集时表现不佳,但其他的呢? 哪种监督/半监督分类器算法最适合大型数据集?
【问题讨论】:
-
例如:基于随机梯度下降的一切:
SGDClassifier(包括线性 SVM),如果选择了正确的方法,可能大部分linear_model(文档)。还有LinearSVC。但巨大是主观的。
标签: machine-learning scikit-learn large-data large-files large-data-volumes