【发布时间】:2016-05-08 19:04:06
【问题描述】:
我知道 Apache Hadoop 提供了 discp 来将文件从 aws s3 复制到 HDFS。但似乎效率不高,而且日志记录不灵活。
在我的项目中,每次向HDFS传输文件成功或失败后,都需要以我们自定义的格式写入日志。由于数据加载量大,用Hadoop MapReduce将aws数据加载到HDFS集群绝对是最高效的,比如说我要写一个类似discp的Hadoop MapReduce作业。
我的计划是让每个节点上的每个 Mapper 加载一个带有aws Java SDK 的 s3 目录,因为有许多 s3 目录要加载到 HDFS。有人可以就如何实现这一目标提出一些建议吗?提前致谢!
【问题讨论】:
-
您在使用 AWS EMR 吗?如果是这样,您是否尝试过直接从 S3 存储桶中读取?
标签: hadoop amazon-s3 mapreduce