【发布时间】:2014-04-23 14:53:56
【问题描述】:
我有一个问题。如何做 Mapreduce Job 来实现 HiveQL 语句。例如,我们有一个包含列名颜色、宽度和其他一些列的表。假设如果我想在 hive 中选择颜色,我可以从 tablename 中选择颜色;。同理,在 Mapreduce 中获取颜色的代码是什么。
【问题讨论】:
标签: hadoop mapreduce hive bigdata
我有一个问题。如何做 Mapreduce Job 来实现 HiveQL 语句。例如,我们有一个包含列名颜色、宽度和其他一些列的表。假设如果我想在 hive 中选择颜色,我可以从 tablename 中选择颜色;。同理,在 Mapreduce 中获取颜色的代码是什么。
【问题讨论】:
标签: hadoop mapreduce hive bigdata
您可以使用 Thrift 服务器。您可以通过 JDBC 连接到 hive。您只需在类路径中包含 hive-jdbc jar。
但是,这是可取的吗?好吧,我不太确定。如果您在映射器中这样做,这是一个非常糟糕的设计模式。映射器的数量由数据大小决定。
MR 作业中的多个输入也可以实现相同的效果。
但是我对您的用例了解不多。所以节俭将是要走的路。
【讨论】:
【讨论】:
查看MapReduce Design Patterns 书中的companion code Chapter 5 - Join Patterns。在连接模式中,字段在映射器中被提取并发出。
【讨论】: