【问题标题】:Reading Csv file written by Dataframewriter Pyspark读取 Dataframewriter Pyspark 编写的 Csv 文件
【发布时间】:2019-07-10 10:37:59
【问题描述】:

我正在使用以下代码将数据框写入 CSV:

df.write.format("csv").save(base_path+"avg.csv")

当我在客户端模式下运行 spark 时,上面 sn-ps 创建了一个文件夹名称 avg.csv 并且该文件夹包含一些带有 part-* 的文件 .csv 在我的工作节点或嵌套文件夹上,然后文件 part-*.csv。

现在当我尝试读取 avg.csv 时,我发现路径不存在。

df.read.format("com.databricks.spark.csv").load(base_path+"avg.csv")

谁能告诉我哪里做错了?

【问题讨论】:

    标签: python csv apache-spark dataframe pyspark


    【解决方案1】:

    Part-00** 文件是分布式计算文件(如 MR、spark)的输出。因此,当您尝试存储时,它将始终是使用部分文件创建的文件夹,因为这是一些分布式存储的输出,请牢记。

    所以,尝试使用:

    df.read.format("com.databricks.spark.csv").load(base_path+"avg.csv/*")
    

    【讨论】:

    • 当我执行此操作时,我得到 File not Found exception: part-00*.csv doesn't exist on executor 2. 虽然这存在于我集群中的一个节点中
    猜你喜欢
    • 2016-12-01
    • 2018-10-11
    • 2021-05-22
    • 2020-09-07
    • 2021-11-19
    • 1970-01-01
    • 2022-12-20
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多