【发布时间】:2015-04-28 07:23:48
【问题描述】:
我是 PIG 的新手,因此绝对是初学者。
我有一个 .txt 文件,其条目如下所示:
Name Matriculation Number Grade Name of Subject ECTS
John William 078932832 2.7 Research 5
John William 078932832 2.3 International Management 10
John William 078932832 1.7 Math 5
如您所见,在文本文件中,有许多关于同一个人但不同科目(当然)成绩不同的条目。 我想计算每个学生的平均成绩。对于样本数据,我必须执行以下操作才能获得平均成绩: (2.7 * 5 + 2.3 * 10 + 1.7 * 5)/ 20 (ects 点的绝对数量)。此示例的结果为 2.25。应该为列表中的每个学生进行此程序。最后,我想要一个包含以下内容的独立 .txt 文件:
Name Matriculation Number Average Grade Number of Subjects Number of ECTS
John William 078932832 2.25 3 20
如何使用 PIG 做到这一点?由于我是初学者,请提供获得结果所需的所有步骤。
谢谢!
【问题讨论】:
标签: hadoop hive apache-pig hadoop2