【发布时间】:2017-12-16 22:08:05
【问题描述】:
我在 Hadoop 上使用 Apache Parquet,过了一会儿我有一个问题。当我在 Hadoop 上的 Spark 中生成镶木地板时,它会变得非常混乱。当我说混乱时,我的意思是 Spark 工作正在生成大量的镶木地板文件。当我尝试查询它们时,我正在处理大量查询,因为 Spark 正在将所有文件合并在一起。
你能告诉我处理它的正确方法吗,或者我可能会误用它们?您是否已经处理过,您是如何解决的?
更新 1: 将这些文件合并到一个镶木地板中的一些“副业”是否足够好?首选使用什么大小的 parquet 文件,一些上下界限?
【问题讨论】:
-
如果这些文件是空的或大小小于 15mb,那么您确实需要重新分区数据,但在所有情况下,我们都无法使用给定的信息为您提供准确的答案。请阅读如何在 SO stackoverflow.com/help/how-to-ask 上提问!
-
还有一个名为
parquet-tools的shell 实用程序,您可以使用它,但应该重新分区。
标签: hadoop apache-spark streaming parquet file-type