【问题标题】:Spark/S3 Importing DataSpark/S3 导入数据
【发布时间】:2015-11-30 17:57:43
【问题描述】:

我创建了一个包含 10 个从属设备的 Spark 集群,并执行了以下操作。

export AWS_ACCESS_KEY_ID=**key_here**
export AWS_SECRET_ACCESS_KEY=**key_here**

cd spark/bin
./pyspark

logs = sqlContext.read.json("s3n://file/path/2015-11-17-14-20-30")

我收到以下错误。

Exception: ("You must build Spark with Hive. Export 'SPARK_HIVE=true' and run build/sbt assembly", Py4JJavaError(u'An error occurred while calling None.org.apache.spark.sql.hive.HiveContext .\n', JavaObject id=o23))

我不确定导出 spark hive 变量后还需要采取哪些其他步骤,或者在哪里可以找到 build/sbt 文件夹。关于如何将这些数据放到集群中的任何建议?

【问题讨论】:

  • 您是从源代码构建 Spark,还是使用供应商或预编译的二进制版本?

标签: apache-spark hive pyspark


【解决方案1】:

Spark S3 访问基于 Hadoop 的 S3 访问 - 如果您自己构建 Spark(看起来像这种情况),请按照说明重新编译(SPARK_HIVE = true 作为环境变量,然后再次运行 sbt)。否则下载 spark 的“prebuilt for Hadoop”版本

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-07-27
    • 1970-01-01
    • 1970-01-01
    • 2021-11-17
    • 2019-06-10
    • 1970-01-01
    相关资源
    最近更新 更多