【发布时间】:2015-11-30 17:57:43
【问题描述】:
我创建了一个包含 10 个从属设备的 Spark 集群,并执行了以下操作。
export AWS_ACCESS_KEY_ID=**key_here**
export AWS_SECRET_ACCESS_KEY=**key_here**
cd spark/bin
./pyspark
logs = sqlContext.read.json("s3n://file/path/2015-11-17-14-20-30")
我收到以下错误。
Exception: ("You must build Spark with Hive. Export 'SPARK_HIVE=true' and run build/sbt assembly", Py4JJavaError(u'An error occurred while calling None.org.apache.spark.sql.hive.HiveContext .\n', JavaObject id=o23))
我不确定导出 spark hive 变量后还需要采取哪些其他步骤,或者在哪里可以找到 build/sbt 文件夹。关于如何将这些数据放到集群中的任何建议?
【问题讨论】:
-
您是从源代码构建 Spark,还是使用供应商或预编译的二进制版本?
标签: apache-spark hive pyspark