【发布时间】:2016-09-14 09:23:39
【问题描述】:
训练数据(包括训练集和验证集)大约有80百万个样本,每个样本有200个密集浮点数。有6 标记的类,它们是不平衡的。
在常用的 ML 库(例如,libsvm、scikit-learn、Spark MLlib、random forest、XGBoost 或其他)中,我应该使用哪个?硬件配置方面,该机拥有24CPU核心和250Gb内存。
【问题讨论】:
-
我会使用 Spark MLlib
-
@DrVComas,谢谢!我还没有安装 Spark。如果方便,请您查看此帖子 [stackoverflow.com/questions/37304536/…?
-
这就是我使用 spark 的原因,如果数据集很大,您可以使用整个数据集毫无问题地训练模型。
-
@DrVComas,是的,现在我发现问题是缩放大规模数据。为了拟合模型,我们应该首先计算全局均值和标准差。
map-reduce非常适合这个任务。
标签: machine-learning scikit-learn random-forest apache-spark-mllib xgboost