【发布时间】:2013-05-02 16:01:09
【问题描述】:
尝试连接 6 个表,每个表中大约有 500 万行。尝试加入在所有表格上按升序排序的帐号。 Map 任务成功完成,reducers 停止工作的比例为 66.68%。尝试了增加减速器数量等选项,还尝试了其他选项 set hive.auto.convert.join = true;并设置 hive.hashtable.max.memory.usage = 0.9;并设置 hive.smalltable.filesize = 25000000L;但结果是一样的。尝试使用少量记录(如 5000 行),查询效果非常好。
请建议在这里可以做些什么来使它发挥作用。
【问题讨论】:
-
您是否有任何帐号在表中具有不成比例的大量记录。表是否在连接之前排序 - 这样您就可以利用 map-side 连接?)。其中一个表是否比其他表大很多(连接中最后列出的那个大表?)
标签: join hadoop mapreduce hive