【发布时间】:2017-10-30 18:48:42
【问题描述】:
我正在尝试使用 sparklyr 加载具有一百万行和 1000 列的数据集。 我在一个非常大的集群上运行 Spark。仍然数据的大小似乎太大了。我尝试了两种不同的方法:
这是数据集:(train_numeric.csv) https://www.kaggle.com/c/bosch-production-line-performance/data
1) - 将 .csv 文件放入 hdfs - spark_read_csv(spark_context, path)
2) - 将 csv 文件作为常规 R 数据帧读取 - spark_frame
这两种方法在数据集的一个子集上都可以正常工作,但是当我尝试读取整个数据集时却失败了。
有人知道适合大型数据集的方法吗?
谢谢, 费利克斯
【问题讨论】:
-
你遇到了什么错误
标签: r apache-spark sparklyr