【发布时间】:2018-04-08 11:58:33
【问题描述】:
在 Spark 2.0 中,我可以将多个文件路径组合到一个加载中(参见例如 How to import multiple csv files in a single load?)。
如何使用 sparklyr 的 spark-read-csv 实现这一目标?
【问题讨论】:
在 Spark 2.0 中,我可以将多个文件路径组合到一个加载中(参见例如 How to import multiple csv files in a single load?)。
如何使用 sparklyr 的 spark-read-csv 实现这一目标?
【问题讨论】:
事实证明,sparklyr 中文件路径的通配符使用与 SparkR 相同,因此可以将多个文件夹组合成一个调用。
【讨论】:
读取 HDFS 上特定文件夹的所有子文件夹中多个编号的 CSV 文件的代码示例:
spark_read_csv(sc, path = "hdfs:///folder/subfolder_*/file[0-9].csv")
请注意,根据生成对象的大小,您可能需要设置参数 memory = FALSE。
【讨论】: