【发布时间】:2016-07-10 02:20:35
【问题描述】:
我正在尝试将 RDD 保存到文本文件中。我的 Spark 实例在 Linux 上运行并连接到 Azure Blob
val rdd = sc.textFile("wasb:///HdiSamples/HdiSamples/SensorSampleData/hvac/HVAC.csv")
//find the rows which have only one digit in the 7th column in the CSV
val rdd1 = rdd.filter(s => s.split(",")(6).length() == 1)
rdd1.saveAsTextFile("wasb:///HVACOut")
当我查看输出时,它不是单个文本文件,而是一个名为 HVACOut 的文件夹中的一系列应用程序/八位字节流文件。
如何将其输出为单个文本文件?
【问题讨论】:
标签: scala azure apache-spark azure-blob-storage azure-hdinsight