【发布时间】:2015-10-08 04:34:00
【问题描述】:
stackoverflow 上的一些帖子的回复包含有关如何通过 Spark SQL 作为 JDBC 分布式查询引擎访问 RDD 表的部分信息。因此,我想询问以下问题以获取有关如何执行此操作的完整信息:
在 Spark SQL 应用中,我们是否需要使用 HiveContext 来注册表?或者我们可以只使用 SQL 上下文吗?
我们在哪里以及如何使用 HiveThriftServer2.startWithContext?
当我们运行
start-thriftserver.sh时
/opt/mapr/spark/spark-1.3.1/sbin/start-thriftserver.sh --master spark://spark-master:7077 --hiveconf hive.server2.thrift.bind.host spark-master --hiveconf hive.server2.trift.port 10001
除了指定 Spark SQL 应用的 jar 和 main 类,我们还需要指定其他参数吗?
- 我们还有什么需要做的吗?
谢谢。
【问题讨论】:
-
请注意,问题不是关于公开 Hive 表的。问题是关于如何通过 thrift-server 公开 Spark SQL 程序的 RDD 表/数据帧。例如,假设我的 Spark SQL 程序提供了自己的 RDD 表/数据帧。并将它们注册为 DataFrame.registerTempTable。它如何将这些 RDD 表/Dataframes 暴露给 Thrift 服务器,以便外部应用程序可以通过 JDBC 访问它们?
标签: apache-spark apache-spark-sql