【发布时间】:2020-01-27 14:36:22
【问题描述】:
我有一个 csv 文件存储在 azure datalake 存储中,我通过在我的 databricks 集群中安装 datalake 帐户将其导入 databricks,在进行预处理后,我想将 csv 存储回同一个 datalakegen2(blobstorage)帐户中。任何线索和对此问题的帮助表示赞赏。谢谢。
【问题讨论】:
标签: azure pyspark databricks azure-data-lake
我有一个 csv 文件存储在 azure datalake 存储中,我通过在我的 databricks 集群中安装 datalake 帐户将其导入 databricks,在进行预处理后,我想将 csv 存储回同一个 datalakegen2(blobstorage)帐户中。任何线索和对此问题的帮助表示赞赏。谢谢。
【问题讨论】:
标签: azure pyspark databricks azure-data-lake
只需将其直接保存到 Blob 存储即可。
df.write.
format("com.databricks.spark.csv").
option("header", "true").
save("myfile.csv")
在本地保存文件然后将其推送到 Blob 中是没有意义的。
【讨论】:
只需在相同的挂载位置写入文件即可。请参阅此处的示例:https://docs.databricks.com/spark/latest/data-sources/azure/azure-datalake-gen2.html#example-notebook
df.write.json("abfss://<file_system>@<storage-account-name>.dfs.core.windows.net/iot_devices.json")
【讨论】: