【发布时间】:2016-06-07 14:26:34
【问题描述】:
我的用例如下:
将RDD 写入saveAsTable 的文件(因此写入ORC 文件)。每次保存都会创建新文件(所以1000 000 的文字给我1000 000 ORC 文件)。我知道每个 RDD 都会创建新的 ORC 文件是很自然的。但是,我不知道从 ThriftServer 查询它们时为什么这么慢。
我的问题是:如何理解这种奇怪的行为?
例如,SELECT COUNT(*) 在 1000 000 行(因此相同的文件)上大约需要 1 minute (!)。
但是,当我将1000 000 行保存到一个文件时,相同的查询在50ms 中有效。
我想了解这种差异。毕竟,1000 000 文件数量很少。
【问题讨论】:
-
使用minimal reproducible example 可能比赏金更好。
-
可能是小文件的问题?如果将它们保存到 HDFS 或 S3
标签: apache-spark