【问题标题】:How to import data from aws s3 to HDFS with Hadoop MapReduce如何使用 Hadoop MapReduce 将数据从 aws s3 导入 HDFS
【发布时间】:2016-05-08 19:04:06
【问题描述】:

我知道 Apache Hadoop 提供了 discp 来将文件从 aws s3 复制到 HDFS。但似乎效率不高,而且日志记录不灵活。

在我的项目中,每次向HDFS传输文件成功或失败后,都需要以我们自定义的格式写入日志。由于数据加载量大,用Hadoop MapReduce将aws数据加载到HDFS集群绝对是最高效的,比如说我要写一个类似discp的Hadoop MapReduce作业。

我的计划是让每个节点上的每个 Mapper 加载一个带有aws Java SDK 的 s3 目录,因为有许多 s3 目录要加载到 HDFS。有人可以就如何实现这一目标提出一些建议吗?提前致谢!

【问题讨论】:

  • 您在使用 AWS EMR 吗?如果是这样,您是否尝试过直接从 S3 存储桶中读取?

标签: hadoop amazon-s3 mapreduce


【解决方案1】:

您是否尝试过 s3as3a 是原始 s3n 的继承者 - 消除了一些限制(文件大小)并提高了性能?还有distcp 的问题似乎是什么——您将哪个文件系统用于S3(s3ns3a?)?最近在 distcp 中完成了一些工作 - 可能值得检查最新版本。

【讨论】:

    猜你喜欢
    • 2021-11-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多