【发布时间】:2017-02-17 05:45:40
【问题描述】:
在我的 mapreduce 程序中,reducer 的输出产生 100 万行输出,但我只需要最初的前 3 行输出。为此,我在我的 Reducer 类中维护一个实例变量,该变量计算它所看到的记录数,并在 3 之后停止发出它们。但减速器仍然必须遍历所有 100 万条记录。有没有办法在读取前 3 条记录后立即停止执行以提高代码的性能。
而且在这里我必须让 reducer 计数为 1 ,这样我的实例变量计数才能正常工作,这也会降低程序的性能。
谢谢,非常感谢您的帮助。
【问题讨论】:
-
我从没想过这种情况,真的,好问题 :)
标签: hadoop mapreduce hadoop2 reduce