【问题标题】:How to save a DataFrame as a csv-file using pyspark?如何使用 pyspark 将 DataFrame 保存为 csv 文件?
【发布时间】:2020-03-21 17:29:21
【问题描述】:

为什么这种方法不起作用?

from pyspark.sql import SparkSession

spark = SparkSession.builder.appName('session').getOrCreate()
df = spark.range(5).toDF("index")
filepath = r"C:/my_favorite_directory"
df.write.csv(filepath)

更新

上面的代码工作正常,问题是我没有指定hadoop二进制路径来引用pyspark编写csv文件所需的winutils二进制文件。

【问题讨论】:

  • 你能提供你得到的确切错误
  • 为什么这种方法不起作用?会发生什么?
  • 感谢您的回复。不幸的是,错误消息太长,无法放入问题的正文中(只允许 30k 个字符)
  • 可以提供最后10-15行错误

标签: python pyspark export-to-csv


【解决方案1】:

您的文件路径应以 .csv 或文件扩展名结尾。您提供的目录是错误的

【讨论】:

  • 感谢您的回复。引用文件而不是目录并不能解决问题。
猜你喜欢
  • 2018-08-30
  • 2016-07-09
  • 2017-03-03
  • 2017-09-12
  • 1970-01-01
  • 1970-01-01
  • 2017-06-18
  • 2017-03-15
  • 1970-01-01
相关资源
最近更新 更多