【问题标题】:Py4JJavaError: An error occurred while calling o389.csvPy4JJavaError:调用 o389.csv 时出错
【发布时间】:2021-01-20 06:44:51
【问题描述】:

我是 pyspark 的新手。我正在使用数据块运行 pyspark。我的数据存储在 Azure Data Lake Service 中。我正在尝试将 csv 文件从 ADLS 读取到 pyspark 数据框。所以我写了以下代码

import pyspark
from pyspark import SparkContext 
from pyspark import SparkFiles

df = sqlContext.read.csv(SparkFiles.get("dbfs:mycsv path in ADSL/Data.csv"), 
   header=True, inferSchema= True)

但我收到错误消息

Py4JJavaError: An error occurred while calling o389.csv.

你能建议我纠正这个错误吗?

【问题讨论】:

    标签: apache-spark pyspark databricks


    【解决方案1】:

    SparkFiles 类用于访问作为 Spark 作业的一部分提供的文件。如果您只需要访问 ADLS 上可用的 CSV 文件,那么您只需要使用spark.read.csv,例如:

    df = spark.read.csv("dbfs:mycsv path in ADSL/Data.csv", 
      header=True, inferSchema=True)
    

    最好不要使用sqlContext,出于兼容性原因保留它。

    【讨论】:

      猜你喜欢
      • 2020-02-10
      • 1970-01-01
      • 2020-08-06
      • 2021-11-15
      • 1970-01-01
      • 1970-01-01
      • 2019-10-27
      • 2019-05-26
      • 1970-01-01
      相关资源
      最近更新 更多