【发布时间】:2019-12-13 03:17:48
【问题描述】:
我正在处理一些数据,而我的代码在 Parquet 文件中写入数据帧需要一分钟多的时间。数据框有大约 90000 行和 10 列。这是我第一次使用spark,所以我不确定这里的时间表现,但我认为这时间太多了。我已经阅读了一些文本以获得更好的性能写入 Parquet,但它还没有帮助。我想知道我可以使用什么类型的参数来获得更好的性能,或者我的数据是否太小,这是正常的时间。
我有一个在我的数据框日期列中迭代的 for 循环。它每天迭代并写入文件。目前在测试中,我的专栏只有一天,所以在这个for循环中只迭代了一次,执行所有其他操作大约需要10秒(其他操作的代码我没有包含在dataframe),但是当它到达这一行写入文件时,需要超过 1 分钟。
if i == 0:
df.write.mode('overwrite').parquet(self.files['parquet'])
else:
df.write.mode('append').parquet(self.files['parquet'])
【问题讨论】:
标签: python performance apache-spark pyspark parquet