【发布时间】:2021-08-08 04:20:50
【问题描述】:
是否有更快的替代方法将 PySpark 数据帧转换为 pandas 数据帧?我确实将“spark.sql.execution.arrow.enabled”设置为“true”,但转换数据帧仍需要数小时。我也尝试过从 spark 写入 parquet,然后使用箭头将其读回,但写入也需要数小时。
奖金,有什么方法可以让 spark 过程快速失败?有时,在上述情况下,我会在几个小时后发现转换花费这么长时间的原因是因为架构数据类型映射错误,如果我不能等待几个小时才能得到那个失败。
【问题讨论】:
标签: pandas apache-spark pyspark pyarrow