【发布时间】:2021-06-22 02:30:52
【问题描述】:
我有一个 json 数组文件,如下所示:
["{\"timestamp\":1616549396892,\"id\":\"1\",\"events\":[{\"event_type\":\"ON\"}]}",{"meta":{"headers":{"app":"music"},"customerId":"2"}}]
我有一个 json 文件,节点如下所示:
我正在尝试通过 spark-shell 在 scala 中读取此文件。
val s1 = spark.read.json("path/to/file/file.json")
但是,这会导致损坏记录错误:
org.apache.spark.sql.DataFrame = [_corrupt_record: string]
我也试过这样读:
val df = spark.read.json(spark.sparkContext.wholeTextFiles("path.json").values)
val df = spark.read.option("multiline", "true").json("<file>")
但还是同样的错误。
由于 json 数组包含字符串和 json 对象,这可能是我无法读取它的原因。
谁能解释一下这个错误?我们如何通过 spark udf 读取它?
【问题讨论】:
标签: json scala apache-spark