【发布时间】:2016-03-05 16:22:20
【问题描述】:
我想创建一个 python 应用程序来使用 Apache Spark 分析 Twitter 流数据。
有什么方法可以在不设置 Hadoop 环境的情况下使用 Apache Spark 流的功能。如何在独立模式下运行 Apache Spark? 我刚刚下载了二进制文件并尝试运行 spark-shell,得到 NullPointerException。有人可以帮忙吗?
<console>:10: error: not found: value sqlContext
import sqlContext.implicits.
<console>:10: error: not found: value sqlContext
import sqlContext.sql
【问题讨论】:
-
首先,这个问题与推特分析无关,所以不要在你的问题中使用误导性的标题。其次,spark-shell 不适用于 python,所以我不确定你要做什么
-
我是Data领域的新手,只是在探索Apache Spark,尝试在windows平台上使用spark流进行一些简单的分析,而无需设置Hadoop环境。
-
好的,但您的问题仍然与此无关!实际上,您不需要设置 hadoop 即可使用 spark,但使用变量时出现错误与数据分析无关。你同意吗?仍然要知道您的问题是什么,因为正如我所说,我不清楚。你用的是哪个外壳?你在做什么来得到这样的错误?等等……
-
你是对的。只是设置火花的环境。我对外壳一无所知,我在 You tube 中找到了一些与 spark 相关的视频,他们使用 spark-shell 并在我的机器上进行了相同的尝试,我得到了这个 SQL 上下文错误,所以我想我在安装时错过了一些东西。使用独立服务器进行数据分析,我现在没有任何方向。如果您找到任何资源,请分享。
-
然后尝试从头开始,Spark 官方文档实际上非常适合此目的;)
标签: apache-spark