【发布时间】:2018-12-20 09:49:56
【问题描述】:
我们正在使用 apache spark,我们将 json 文件作为 gzip 压缩的 parquet 文件保存在 hdfs 中。但是,当读回它们以生成数据帧时,某些文件(但不是全部)会引发以下异常:
ERROR Executor: Exception in task 2.0 in stage 72.0 (TID 88)
org.apache.parquet.io.ParquetDecodingException: Can not read value at 351 in
block 0 in file file:/path/to/file [...]
Caused by: java.lang.ClassCastException:
org.apache.spark.sql.catalyst.expressions.MutableLong cannot be cast to
org.apache.spark.sql.catalyst.expressions.MutableDouble
非常感谢任何帮助!
【问题讨论】:
标签: apache-spark parquet