【问题标题】:nutch running on EMR在 EMR 上运行的 nutch
【发布时间】:2014-05-05 19:02:40
【问题描述】:

有人可以引导我走向正确的方向吗?我正在尝试让 Nutch 在 Amazon EMR 上工作。到目前为止,我可以让 nutch 在本地运行,并使用它附带的 shell 脚本启动它。

但是,在亚马逊上,我需要指定 JAR 位置和选项。我可以自己编译得到jar。但是,就启动选项而言,我不知道从哪里开始。

此外,1.x 和 Nutch 2.0 之间的主要区别是什么。是否在 EMR 上推荐一个而不是另一个?

【问题讨论】:

    标签: nutch amazon-emr


    【解决方案1】:

    如果你还在寻找答案:

    当您构建 Nutch 时,您会在部署目录中看到一个作业 jar,将其上传到 S3 并在设置 EMR 作业流程时引用它,因为您是自定义 Jar。

    然后您可以添加步骤并提及主类,例如:org.apache.nutch.crawl.Crawl 和您想要的参数。这与它在local 模式下的工作方式没有什么不同。例如:urls -dir myCrawl -threads 10 -depth 5 -topN 1000

    如果您打算使用 Crawl.java 以外的其他内容,则可以通过查看 bin/nutch 脚本来了解要使用的主类。

    【讨论】:

    • 对不起,我没有解决你上面的第二个问题。我更喜欢在 EMR 上使用 1.x,以便我可以将 crawlDb 移回 S3,如果您在不同的机器上设置了 NoSQL 以使用可能成为性能瓶颈的 2.x。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-07-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-06-09
    • 2014-06-11
    相关资源
    最近更新 更多