【发布时间】:2016-01-29 10:13:59
【问题描述】:
让我们假设我的 HDFS 块大小等于 256Mb,并且我需要在 OCR/Parquet 文件中存储 20Gb 的数据,将所有数据存储在一个 OCR/Parquet 文件中更好吗?最好将其存储在许多 256Mb(HDFS 块大小)的 ORC/Parquet 文件中?
提前致谢。
【问题讨论】:
-
如果文件以块大小的倍数存储,HDFS I/O 会更好地工作。太小或太大的文件都不能很好地执行。我会将 20GB 文件视为大文件。对于处理引擎(HIVE、Spark、Mapreduce),保持文件分割极大地提高了性能。尽管 Hadoop 可以拆分大文件,但最好将它们分开,这样可以缩短初始启动时间。
-
您好,首先感谢您的回答。否则为什么手动拆分文件会提高初始启动时间?如果 M/R 工作这样做有什么区别?
-
嗨,迈赫迪。请在下面找到我的答案。系统不允许在 cmets 下添加长答案。
-
非常感谢!我会在下面回答!
标签: hadoop ocr parquet bigdata