【发布时间】:2017-02-07 04:43:05
【问题描述】:
我正在尝试对 SQL 查询建模,例如 select distinct (col1) from table where col2= value2 in map reduce。我使用的逻辑是每个映射器将检查 where 子句,如果找到匹配项,它将发出 where 子句值作为键和 col1 作为值。基于默认的散列函数,所有输出都将与 where 子句中的 key used value 进入相同的 reducer。在 reducer 中,我可以排除重复值并发出不同的值。这是正确的做法吗?
这是实现此功能的正确方法吗?
注意:此查询的数据在 CSV 文件中。
【问题讨论】:
-
你试过Hive吗?
-
我需要使用 map reduce 框架来完成。我使用的逻辑是每个映射器都将检查 where 子句,如果匹配将发出 where 子句作为键和 col1 作为值。基于默认的散列函数,所有的输出都会去同一个reducer。在 reducer 中,我可以排除重复并发出不同的值。这是正确的方法吗?
标签: hadoop mapreduce hdfs bigdata