【问题标题】:Running hadoop jobs on Amazon ec2: multi node cluster在 Amazon ec2 上运行 hadoop 作业:多节点集群
【发布时间】:2011-12-14 02:41:21
【问题描述】:

我必须在 Amazon EC2 集群上运行 hadoop mapreduce 作业。

我尝试使用现有 AMI 进行设置。但是在启动 master 和 clients 之后,“jps”并没有列出任何节点。

所以即使在使用公共 hadoop AMI 之后,我们是否必须为 master 和 slave 进行 hadoop 设置? master如何知道slave的IP地址??

谁能告诉我一些好的文件。 我现在已经为此努力了 12 多个小时。

有人可以帮忙吗?

谢谢。

【问题讨论】:

    标签: amazon-ec2 hadoop mapreduce


    【解决方案1】:

    Matthew 建议的另一个替代方法是使用 Whirr。

    Whirr 让在 Amazon 上部署 Hadoop 集群变得非常容易,而且您无需为 mapreduce 实例付费。并且可以控制集群的版本。

    这是项目主页: http://whirr.apache.org/

    这里是安装 Hadoop 的快速入门指南。运行 Hadoop 集群大约需要 5 分钟。 http://whirr.apache.org/docs/0.6.0/quick-start-guide.html

    【讨论】:

    • 良好的链接。在过去的 12 个月里,Whirr 已成为一种可行的替代方案。
    【解决方案2】:

    我会改用 Amazon 的 Elastic MapReduce 框架。您可以动态地启动和关闭机器和集群,而不必担心将它们配置为相互通信。

    http://aws.amazon.com/elasticmapreduce/

    很多人都在使用它,而且它大多是可靠的。它将为您节省大量通常用于设置和管理集群的工作。只有一件事与常规的 hadoop 不同 - 最好将内容放在 S3 而不是 HDFS 中(因为集群是瞬态的,因此 HDFS 数据会随着集群而消失)。

    【讨论】:

    • 很好的答案。应该注意,弹性 MR 比在 ec2 集群上设置自己的成本略高,如果集群足够大,可能会加起来。
    • 只有在您不使用现场实例时才如此。专业提示:将 1/2 的节点设为现货定价的 TASK 节点,您将节省大量资金。
    • 啊,我从来不知道......谢谢马修。你救了我一些硬币!
    • 没问题:-)。这是一个相当新的功能。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-02-01
    • 2011-08-13
    • 1970-01-01
    • 2023-03-08
    • 2011-10-05
    相关资源
    最近更新 更多