【问题标题】:Python Pandas read csv from DataLakePython Pandas 从 DataLake 读取 csv
【发布时间】:2021-01-22 13:08:00
【问题描述】:

我正在尝试读取存储在 Azure Data Lake Gen 2 上的 csv 文件,Python 在 Databricks 中运行。 这是两行代码,第一行有效,第二行失败。 我真的必须挂载 Adls 才能让 Pandas 能够访问它吗?

data1 = spark.read.option("header",False).format("csv").load("abfss://oper-iot-uploads@xxx.dfs.core.windows.net/belgium/dessel/c3/kiln/temp/Auto202012101237.TXT")
data2 = pd.read_csv("abfss://oper-iot-uploads@xxx.dfs.core.windows.net/belgium/dessel/c3/kiln/temp/Auto202012101237.TXT")

有什么建议吗?

【问题讨论】:

    标签: python pandas databricks azure-databricks


    【解决方案1】:

    Pandas 不了解云存储,只能处理本地文件。在 Databricks 上,您应该能够在本地复制文件,以便您可以使用 Pandas 打开它。这可以通过%fs cp abfss://.... file:///your-locationdbutils.fs.cp("abfss://....", "file:///your-location") 完成(参见docs)。

    另一种可能性是代替 Pandas,使用在 Spark 之上提供与 Pandas 兼容的 API 的 Koalas library。除了能够访问云中的数据外,您还可以以分布式方式运行代码。

    【讨论】:

    • 谢谢,但是对于“简单”的东西的额外库将是一种矫枉过正。安装 ADLS 帮助了我。 KR,哈里
    【解决方案2】:

    我可以通过将云存储安装为驱动器来解决它。现在工作正常。

    【讨论】:

      猜你喜欢
      • 2017-06-04
      • 2021-10-24
      • 2019-07-16
      • 2021-12-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-01-29
      相关资源
      最近更新 更多