【问题标题】:Reading files from multiple sub folders in sparklyr从 sparklyr 中的多个子文件夹中读取文件
【发布时间】:2018-04-08 11:58:33
【问题描述】:

在 Spark 2.0 中,我可以将多个文件路径组合到一个加载中(参见例如 How to import multiple csv files in a single load?)。

如何使用 sparklyr 的 spark-read-csv 实现这一目标?

【问题讨论】:

    标签: r sparklyr


    【解决方案1】:

    事实证明,sparklyr 中文件路径的通配符使用与 SparkR 相同,因此可以将多个文件夹组合成一个调用。

    【讨论】:

      【解决方案2】:

      读取 HDFS 上特定文件夹的所有子文件夹中多个编号的 CSV 文件的代码示例:

      spark_read_csv(sc, path = "hdfs:///folder/subfolder_*/file[0-9].csv")
      

      请注意,根据生成对象的大小,您可能需要设置参数 memory = FALSE。

      【讨论】:

      • 是否可以为子文件夹定义一个数值范围。例如,我的子文件夹只有 2 位数字,每个数字表示一个月中的某一天 {01, 02 ,03 ... 31} ?
      猜你喜欢
      • 1970-01-01
      • 2015-07-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-11-26
      • 1970-01-01
      • 1970-01-01
      • 2016-10-09
      相关资源
      最近更新 更多