【发布时间】:2017-02-12 16:11:06
【问题描述】:
有几个这样的问题,没有答案,比如这个here.
我想我会发布另一个希望得到一个。
我有一个带有重复行的配置单元表。考虑以下示例:
*ID Date value1 value2*
1001 20160101 alpha beta
1001 20160201 delta gamma
1001 20160115 rho omega
1002 20160101 able charlie
1002 20160101 able charlie
完成后,我只想要两条记录。具体来说,这两个:
*ID Date value1 value2*
1001 20160201 delta gamma
1002 20160101 able charlie
为什么是那两个?对于 ID=1001,我想要最新的日期和该行中的数据。对于 ID=1002,答案其实是一样的,但是具有该 ID 的两条记录完全重复,我只想要一条。
那么,关于如何做到这一点有什么建议吗?使用 ID 和“最大”日期的简单“分组依据”将不起作用,因为它忽略了其他列。我不能把'max'放在那些上面,因为它会从所有记录中提取最大列(将从旧记录中提取'rho'),这不好。
我希望我的解释是清楚的,我感谢任何见解。
谢谢
【问题讨论】:
-
this 有帮助吗?
-
感谢 mtoto。效果很好!!!我想我将不得不进入Windowing。发布为“答案”,你会得到一张支票。
标签: hadoop apache-spark mapreduce hive