【发布时间】:2019-06-21 20:52:18
【问题描述】:
在这里,我有 python 实用程序来使用 Pyarrow 库为单个数据集创建多个镶木地板文件,因为一天的数据集大小很大。这里 parquet 文件在每个拆分 parquet 文件中包含 10K parquet 行组,最后我们将拆分文件合并到一个文件中以创建一个大的单个 parquet 文件。在这里,我正在创建两个 Impala 表,其中包含一个合并文件和多个拆分文件。
当在 Impala 表中加载拆分文件数据并尝试查询它时,结果会在几秒钟内变得更快,但是当 Impala 表在单个合并的 parquet 文件上创建时。与提到的拆分文件 Impala 表相比,它会出现性能问题。在尝试计算 Impala 表上的统计信息时,我无法识别这两个表之间的差异。
任何想法,为什么多拆分拼花文件 Impala 表和单个合并拆分文件 Impala 表之间的性能行为差异。
【问题讨论】:
标签: apache-spark hadoop parquet impala pyarrow