【发布时间】:2020-11-04 05:14:44
【问题描述】:
FROM (
FROM pv_users
SELECT TRANSFORM(pv_users.userid, pv_users.date)
USING 'python mapper.py'
AS dt, uid
CLUSTER BY dt) map_output
INSERT OVERWRITE TABLE pv_users_reduced
SELECT TRANSFORM map_output.dt, map_output.uid
USING 'python reducer.py'
AS date, count;
map reduce 在这个查询中是如何工作的,"CLUSTER BY" 在这个查询中的意义是什么?
【问题讨论】:
标签: hadoop hive mapreduce hiveql hadoop-partitioning