【发布时间】:2017-01-27 16:04:28
【问题描述】:
我在一个目录中有很多文件,每个文件都包含多行的文本。 目前,我使用以下代码将所有这些文件读取到 spark 数据集 (>2.0)
val ddf = spark.read.text("file:///input/*")
但是,这会创建一个数据集,其中每一行都是一行,而不是一个文件。我想在数据集中的每行都有每个文件(作为字符串)。
如何在不遍历每个文件并将其作为RDD 单独读取的情况下实现此目的?
【问题讨论】:
标签: scala apache-spark apache-spark-sql