【发布时间】:2017-04-24 19:06:55
【问题描述】:
我是大数据新手!我有一些关于如何在 EMR 集群上处理以及如何在 spark 中保存大量小文件(pdf 和 ppt/pptx)的问题。
我的目标是将数据(pdf 和 pptx)保存到 HDFS(或集群中的某种类型的数据存储中),然后从 spark 中提取该文件中的内容并将其保存在 elasticsearch 或某些关系数据库中。
我在HDFS中保存数据时读到了小文件的问题。保存大量 pdf 和 pptx 文件(最大大小 100-120 MB)的最佳方法是什么?我已经阅读了有关序列文件和 HAR(hadoop 存档)的信息,但没有一个我不明白它是如何工作的,我也不知道什么是最好的。
处理这些文件的最佳方法是什么?我知道某些解决方案可能是 FileInputFormat 或 CombineFileInputFormat 但我不知道它究竟是如何工作的。我知道不能在单独的任务上运行每个小文件,因为集群会陷入瓶颈。
谢谢!
【问题讨论】:
-
我在 Hadoop 上处理了一个 PDF 文件希望下面的链接对 ybhavesh.blogspot.in/2015/12/… 有帮助(注意:处理是在 Mapreduce 中完成的)
标签: hadoop apache-spark hdfs amazon-emr