【发布时间】:2019-03-31 17:24:16
【问题描述】:
我有一个问题,即每 15 分钟创建一次文件,所以在一个月内我将拥有 ~ 2880 个文件。一年后我将拥有 35,000 个文件!压缩可能是一种选择,这意味着我每小时有 1 个镶木地板文件 = 8760 个文件!
但是我想知道使用"$path"比较文件名与使用分区有何不同?分区修剪在单个线程中完成,而不是分布在 Hadoop 集群上。因此,如果我将 35,000 个文件分成 year=????/day=365/hour=24/4 个文件,那么 比较文件名的性能是否与使用分区修剪相同? p>
PS:我知道我可以存档旧文件。
【问题讨论】:
标签: optimization hive amazon-athena presto