【发布时间】:2017-12-19 15:10:56
【问题描述】:
我使用 fileStream 从 Spark(流上下文)中读取 hdfs 目录中的文件。如果我的 Spark 在一段时间后关闭并启动,我想读取目录中的新文件。我不想读取目录中已被 Spark 读取和处理的旧文件。我在这里尽量避免重复。
val lines = ssc.fileStream[LongWritable, Text, TextInputFormat]("/home/File")
任何代码 sn-ps 可以帮助?
【问题讨论】:
标签: scala hadoop apache-spark spark-streaming