【发布时间】:2023-03-31 12:20:01
【问题描述】:
我想扩展hadoop字数统计的hello world程序,使其能够统计输入文件中的字母数。
到目前为止,我已经写了这个,但我无法弄清楚这段代码有什么问题。任何识别问题的帮助将不胜感激。
A = load '/tmp/alice.txt';
B = foreach A generate flatten(TOKENIZE((chararray)$0)) as word;
C = filter B by word matches '\\w+';
D = foreach C generate flatten(REGEX_EXTRACT_ALL(word, '([a-zA-Z])')) as letter;
E = group D by letter;
F = foreach E generate COUNT(D), group;
store F into '/tmp/alice_wordcount';
【问题讨论】:
-
字母数是指每个字母出现的次数。
-
请不要破坏您的问题。
标签: apache-pig bigdata