【问题标题】:Find Maximum Columns in a grouped row. [using PIG]在分组行中查找最大列。 [使用猪]
【发布时间】:2016-05-23 12:07:23
【问题描述】:

我必须使用给定的一组数据找到由个人创建的帖子的最大数量,其中向我提供了用户 ID、显示名称、年龄、cmets 计数、查看次数、日期、分数和每个帖子的标题。

为了获得最大帖子的数量,我想,我们可以按用户id分组。现在,分组后,我需要检查没有最多的id。的列。我不明白我将如何解决后半部分。请帮忙。

【问题讨论】:

  • title 是“Find Maximum Columns in a grouped row”,而您的问题是“find maximum number of posts created by person”。我想你编辑你的问题然后问。 @斯瓦蒂
  • 告诉我们您的问题到底是什么?
  • @AnkurSingh ,我想问一下,他们基本上指向同一件事。对不起,如果我不能让你理解的话。让我再试一次。我的意思是问,在按 id 分组数据后,输出将是按每个 id 分组的详细信息。现在,如果我想找到最大值。的帖子,我需要添加列,即最大数量附有任何 id 的列将返回我们最大的编号。任何人创建的帖子。
  • 好的,我在等@Swati Sneha
  • 如果可能的话,你能给我们你的虚拟数据吗?这样对我们来说很容易

标签: hadoop apache-pig bigdata


【解决方案1】:

作为什么,我从你的问题中理解。我给你相应的答案。

让我们试试这个代码:

a = load '<path>' using PigStorage(',') as(userId,displayName,age,commentsCount,viewCount,date,score,title)

b = group a by userId;

c = foreach b generate group,COUNT(a.title);

dump c;

【讨论】:

  • 运行此代码。这对您的问题是否正确。如果没有,那么评论我。 @Swati Sneha
  • 当然。但是,你为什么要计算标题?计数名称可能更相关。不是吗?
  • 您在哪里按用户 ID 分组,那么答案将不受影响。即.. 描述:Bag{userId , {( ),( ),( )}}。
  • 分组之后,主要是你必须计算那个给包中的元组..即userId包
  • 我错过了关键字计数。实际上,我对此很陌生:(
猜你喜欢
  • 1970-01-01
  • 2021-11-05
  • 1970-01-01
  • 2020-08-21
  • 2017-09-04
  • 2019-11-10
  • 2017-03-30
  • 2016-05-12
  • 2019-09-03
相关资源
最近更新 更多