【发布时间】:2017-06-20 17:52:27
【问题描述】:
我是 Spark 的新手,我一直在尝试将 Dataframe 转换为 Spark 中的 parquet 文件,但还没有成功。 documentation 说我可以使用 write.parquet 函数来创建文件。但是,当我运行脚本时,它显示:AttributeError: 'RDD' object has no attribute 'write'
from pyspark import SparkContext
sc = SparkContext("local", "Protob Conversion to Parquet ")
# spark is an existing SparkSession
df = sc.textFile("/temp/proto_temp.csv")
# Displays the content of the DataFrame to stdout
df.write.parquet("/output/proto.parquet")
你知道怎么做吗?
我使用的 spark 版本是为 Hadoop 2.7.3 构建的 Spark 2.0.1。
【问题讨论】:
-
sc.textFile()返回RDD。 -
是的,我刚刚意识到。我刚改成 SparkSession 而不是 SparkContext
标签: python pyspark spark-dataframe