【发布时间】:2018-04-23 08:35:36
【问题描述】:
我是listening 到hdfs 目录的xml 记录与spark-streaming-textFileStream()。问题是我的记录很大(而且是单行的);它们的大小可以接近 1G。
我愿意:
val xmlStream = ssc.textFileStream(monitoredDirectory).map { ("",_) }
但 spark 将我的文件拆分为更好的并行处理。 Xml 是一种不可分割的格式,我对文件的处理并没有很好地结束。
如何告诉 spark 不要拆分我的文件?还是有其他方法来处理大型 xml 文件?
【问题讨论】:
-
可以添加当前使用的代码吗?
-
代码,就这么简单。
-
您使用的是什么版本的 spark?您是否试图简单地将文件作为整个文本文件读取?是否有理由使用火花流而不是结构化流?
-
我使用的是 spark 1.6,所以没有结构化流。
-
您是否已经尝试过spark-xml 库?
标签: xml scala hdfs spark-streaming