【发布时间】:2020-02-04 06:56:31
【问题描述】:
因为我想从 binaryFiles 中提取数据,所以我使用
val dataRDD = sc.binaryRecord("Path") 我得到的结果是org.apache.spark.rdd.RDD[(String, org.apache.spark.input.PortableDataStream)]
我想提取我的文件内容,格式为PortableDataStream
为此我尝试过:val data = dataRDD.map(x => x._2.open()).collect()
但我收到以下错误:
java.io.NotSerializableException:org.apache.hadoop.hdfs.client.HdfsDataInputStream
如果您知道如何解决我的问题,请帮忙!
非常感谢。
【问题讨论】:
标签: scala apache-spark rdd