【发布时间】:2020-02-10 16:37:04
【问题描述】:
我可以从具有glueContext 的粘合作业中读取在粘合数据目录中定义的表。 但是,如果我想使用 hiveContext 读取完全相同的表,我会收到一条错误消息,指出它找不到该表。
在我看来,HiveContext 无法访问粘合数据目录。
你知道在胶水作业配置中插入什么(编辑作业->作业参数->“--conf xyz”)以确保HiveContext可以找到和访问胶水数据目录中的表吗?
我想执行以下代码:
# import libs
from pyspark.context import SparkContext
from pyspark.sql.functions import *
from pyspark.sql.types import *
from pyspark.sql import HiveContext
# create sparkContext and HiveContext
sc = SparkContext()
hc = HiveContext(sc)
# read table from glue data catalogue
df = hc.table('glue_db.glue_table').persist()
上面的代码返回如下错误信息:
pyspark.sql.utils.AnalysisException: u"找不到表或视图:
glue_db.glue_table;;\n'UnresolvedRelationglue_db.glue_table\n"
我已经尝试过 spark2.2 和 spark2.4 的 spark 版本
非常感谢!
【问题讨论】:
-
我在使用最新版本的 EMR 时遇到了这样的问题。我不得不回到 5.26.0。我不确定你的情况,但试试看。
标签: amazon-web-services apache-spark aws-glue hivecontext