【发布时间】:2021-07-20 18:57:07
【问题描述】:
我有两个问题:
-
我们可以在调用
coalesce时设置比HDFS 块大小更少的分区吗?例如假设我的文件大小为 1 GB,HDFS 块大小为 128MB,我可以coalesce(1)吗? -
众所周知,HDFS 上的输入文件是根据块大小进行物理分割的。当我们重新分区或更改并行度时,Spark 是否会进一步拆分数据(物理上)?
【问题讨论】:
标签: apache-spark
我有两个问题:
我们可以在调用coalesce 时设置比HDFS 块大小更少的分区吗?例如假设我的文件大小为 1 GB,HDFS 块大小为 128MB,我可以coalesce(1)吗?
众所周知,HDFS 上的输入文件是根据块大小进行物理分割的。当我们重新分区或更改并行度时,Spark 是否会进一步拆分数据(物理上)?
【问题讨论】:
标签: apache-spark
例如,假设我的文件大小为 1 GB,hdfs 块大小为 128MB。我可以合并(1)吗?
是的,您可以合并到单个文件并将其写入外部文件系统(至少使用 EMRFS)
当我们重新分区或更改并行度时,Spark 是否会进一步拆分数据(物理上)?
repartition 将数据分成独立于原始输入文件的分区的分区。
【讨论】: