【发布时间】:2013-12-31 18:22:56
【问题描述】:
我有这样的事情:
ColA ColB
a xxx
b yyy
c xxx
d yyy
e xxx
我需要找出ColB 的每个值出现的次数。
输出:
xxx 3
yyy 2
这是我一直在尝试的:
考虑到A 有我的数据,
grunt> B = GROUP A by ColB;
grunt> DESCRIBE B;
B: {group: chararray,A: {(ColA: chararray,ColB: chararray)}}
现在我很困惑,我应该这样做吗?
grunt> C = FOREACH B GENERATE COUNT(B.ColB)
所以我需要输出是这样的,
xxx 3
yyy 2
【问题讨论】:
标签: hadoop mapreduce apache-pig cloudera