【发布时间】:2021-08-05 01:13:52
【问题描述】:
我正在尝试使用 SparkSQL 以 Parquet 格式将我的数据库导出到我的 S3。
我的一个表包含 > 2GB 的行大小。 Spark 是通过--conf spark.executor.memory=21g --conf spark.executor.memoryOverhead=9g --conf spark.executor.cores=8 提交的。
Spark 似乎有一个限制:Maximum size of rows in Spark jobs using Avro/Parquet。但不确定是不是这样。
有解决办法吗?
【问题讨论】:
-
你检查过数据帧的分区数吗?有时增加分区数量可以解决问题。
标签: apache-spark apache-spark-sql