【发布时间】:2021-05-13 20:50:21
【问题描述】:
我必须从 Azure 数据湖中读取一堆 JSON 文件。我正在使用 Databricks,当我使用使用 Spark 2.4.5 的集群时,我能够读取所有文件,但是当我使用 Spark 3.0.1 时,返回的数据帧为空。 我正在使用以下命令,
dfa = spark.read.json("dbfs:/mnt/abc/bronze/xyz/history/*.json", multiLine=True)
dfb = dfa.select(explode("result").alias("result"))
dfc.show(truncate = False)
#this returns 0 records with Spark 3 but returns the data when the notebook is attached to Spark 2.4
我尝试了多种选项,例如在读取文件时更改编码,但没有奏效。
文件内容很直接,文件内容类似这样,
{
"result": [
{
"number": "abc123",
"active": "false",
"cat_item.category": ""
}
]
}
【问题讨论】:
标签: apache-spark pyspark azure-databricks