【发布时间】:2016-04-14 16:32:02
【问题描述】:
在 spark-shell (scala) 中,我们导入, org.apache.spark.sql.hive.thriftserver._ 用于以编程方式为特定 hive 上下文启动 Hive Thrift 服务器 HiveThriftServer2.startWithContext(hiveContext) 为该特定会话公开已注册的临时表。
我们如何使用 python 做同样的事情? python 上是否有用于导入 HiveThriftServer 的包/api?任何其他想法/建议表示赞赏。
我们使用 pyspark 来创建数据框
谢谢
拉维·纳拉亚南
【问题讨论】:
-
为什么你需要一个 Thrift 服务器,因为它是一个临时表?你不能创建自己的 Hivecontext 来连接到本地临时创建的元存储吗?
-
顺便说一句,你为什么需要从你的代码开始呢?
-
如果我们将 thrift 服务器作为守护进程启动,我们将无法查看临时表(会话与我们启动 HiveContext 的会话不同,临时表将可用于特定会话)
-
您正在启动 Metastore 服务吗?如果不是,我并不感到惊讶,因为当你运行 Spark Thrift 服务器时,它会创建它的 Metastore 后端。在您的代码中,您还创建了另一个 Metastore 后端,这两个 Metastore 是独立的。
-
你知道怎么做吗?
标签: python scala hive thrift hivecontext