【发布时间】:2015-12-24 21:26:18
【问题描述】:
我是 Hadoop 新手,正在玩 WordCount 示例。
我遇到了一个令我困惑的问题。例如,如果我从文本文件中计算字数,并且我想以这样的方式过滤它,以便输出中只有超过 5 个字母的单词,我是否必须运行 2 个作业才能做到这一点?
第一个工作是统计字数,第二个工作是过滤少于 5 个字母的单词?
或者我可以将逻辑写入reducer,如果出现少于5次,不会将单词写入结果文件?如果有多个 reducer 实例在运行,这会导致无效的输出吗?
【问题讨论】:
标签: hadoop