【发布时间】:2020-03-16 04:47:26
【问题描述】:
我有一个大的 pyspark 数据框,我正在对它执行一些转换并与其他数据框连接。我想调查转换和连接是否成功,以及数据帧是否符合预期,但我怎样才能显示数据帧的一小部分。
我尝试了很多东西,例如
df.show(5)
和
df.limit(5).show()
但我尝试的所有操作都需要大量作业,从而导致性能下降。 我可以启动一个非常大的集群,但是有没有办法快速获取数据帧的一小部分?
【问题讨论】:
-
考虑限制数量。对于进入数据框的行(来自源)
-
Spark 是惰性的,它会等待诸如
show()之类的操作来调用 DAG 操作。另一个解决方案是管理您的分区,而不是更大的集群。你怎么处理?默认数字?
标签: python dataframe pyspark databricks azure-databricks