【发布时间】:2020-07-20 21:12:07
【问题描述】:
根据此处的 Apache Nutch 1.16 Fetcher 类实现 - https://github.com/apache/nutch/blob/branch-1.16/src/java/org/apache/nutch/fetcher/Fetcher.java,这是一个仅限地图的工作。 我没有在 Job 中看到任何减速器设置。所以我的问题是为什么不设置 job.setNumreduceTasks(0) 并通过直接输出到 HDFS 来节省时间。
【问题讨论】:
标签: mapreduce web-crawler nutch