【发布时间】:2015-12-18 18:23:24
【问题描述】:
在使用 Spark Streaming 和内置的 HDFS 支持时,我遇到了以下不便:
dStream.saveAsTextFiles 在 HDFS 中生成许多子目录。 rdd.saveAsTextFile 还为每组部件创建子目录。
我正在寻找一种将所有部分放在同一路径中的方法:
myHdfsPath/Prefix_time-part0XXX
而不是
myHdfsPath/Prefix_time/part0XXX
这样我以后可以通过扫描单个 HDFS 目录更轻松地遍历这些文件。
【问题讨论】:
标签: scala apache-spark hdfs spark-streaming