【发布时间】:2020-03-06 07:24:50
【问题描述】:
我有一个数据集(15 GB):7200 万条记录和 26 个特征。我想比较 7 个有监督的 ML 模型(分类问题):SVM、随机森林、决策树、朴素贝叶斯、ANN、KNN 和 XGBoosting。我创建了一个包含 720 万条记录的样本集(占整个集的 10%)。在样本集上运行模型(甚至是特征选择)已经是一个问题。它的处理时间很长。我目前只使用 RStudio。
我这几天一直在寻找问题的答案。我尝试了以下事情: - data.table - 仍然不足以减少处理时间 - sparklyr - 无法复制我的数据集,因为它太大了
我正在为我的问题寻找一种无成本的解决方案。有人可以帮帮我吗?
【问题讨论】:
-
数据的来源是什么?它是 .csv、数据库连接等吗?如果我们知道数据的来源,我们就可以考虑如何将其导入 Spark。
-
嗨 Raphael,这是一个 csv 文件。没有数据库连接。我刚从一个网站下载。
标签: r large-data feature-selection sparklyr supervised-learning