【发布时间】:2017-06-23 09:57:39
【问题描述】:
这在 Apache Hive 的 wiki 页面上有说明:
如果除了一个被连接的表之外的所有表都很小,则连接可以作为仅地图作业执行。查询
SELECT /*+ MAPJOIN(b) */ a.key, a.value
FROM a JOIN b ON a.key = b.key
不需要减速器。对于 A 的每个映射器,B 都被完全读取。
如果要连接的表中的一个很小,而另一个表大到足以耗尽单个映射器的资源,映射器的数量是如何确定的? 那么join会自动变成non-map join吗?
【问题讨论】:
标签: join hive mapreduce hiveql hadoop2