【发布时间】:2019-06-11 07:26:04
【问题描述】:
我的数据按数据静态分区并按国家/地区动态分区。所以对于每个日期,我可以有多达 180 个国家分区。看起来像这样:
/20180101/cntry=us/ => 100kb
/cntry=ca/ => 500kb
/cntry=uk/ => 1.5mb
对于每个日期,数据都很小(大约 20-100mb),并且在国家/地区分区之间进行划分。我想知道对于这样的情况,哪种方法会更好?重新分区还是合并?由于数据很小,合并会更好吗?我很困惑什么时候合并或重新分区会是更好的选择,具体取决于数据的大小。
【问题讨论】:
-
@y2k-shubham 如果我使用重新分区,我怎么知道分区的数量?
-
正如@Lior Chaga已经指出的那样,这是一个痛苦的trial-and-error process
标签: scala apache-spark partitioning