【问题标题】:AWS Hadoop MapReduce - Word Count AverageAWS Hadoop MapReduce - 平均字数
【发布时间】:2020-06-04 01:14:25
【问题描述】:

您好,我有一个 csv 数据文件,如下所示。

bus,train,bus,TRAIN,car,bus,Train,CAr,car,Train,Cart,Bus,Bicycle,Bicycle,Car,Bus,Cart,Cart,Bicycle,Threewheel

我需要使用 MapReduce 计算上述 CSV 中的平均字数。

例如:总线 = 5/20 =0.25

我可以轻松获得字数,但我需要记录总数(在本例中为 20)来获取平均字数。但是通过使用全局变量来减少函数并没有成功。我试图将其作为地图中的键值对传递。 Key = “Total” Value = reducer 输入的总计数。它也没有成功。

有什么建议可以将此 Total Count 从 Map 函数传递到 Reducer 函数?

如果这是需要的信息,我在 EMR 集群中使用了一个主服务器和 3 个从服务器。

提前谢谢你!!!

【问题讨论】:

    标签: amazon-web-services hadoop mapreduce bigdata word-count


    【解决方案1】:

    一旦你有了 (K, V) 对,其中 K 是单词,V 是它出现的次数,你就可以把所有的都映射到一个键上,比如说 (W, (K, V))。现在您可以减少以获得总字数。然后,您可以进行另一个 map/reduce 步骤以将旧键与新计数连接起来。 希望对您有所帮助。

    【讨论】:

      猜你喜欢
      • 2015-04-07
      • 1970-01-01
      • 2010-12-30
      • 1970-01-01
      • 1970-01-01
      • 2011-02-02
      • 1970-01-01
      • 1970-01-01
      • 2014-10-11
      相关资源
      最近更新 更多