【发布时间】:2015-04-11 19:02:46
【问题描述】:
这是我们使用 apache spark 和 hadoop 等大数据工具的第一步。
我们已经安装了 Cloudera CDH 5.3。从cloudera manager我们选择安装spark。 Spark 在集群中的一个节点上运行良好。
我从我的机器上创建了一个小应用程序,用于连接读取存储在 hadoop HDFS 上的文本文件。
我正在尝试从 Eclipse 运行应用程序,它会显示这些消息
15/02/11 14:44:01 INFO client.AppClient$ClientActor: Connecting to master spark://10.62.82.21:7077...
15/02/11 14:44:02 WARN client.AppClient$ClientActor: Could not connect to akka.tcp://sparkMaster@10.62.82.21:7077: akka.remote.InvalidAssociation: Invalid address: akka.tcp://sparkMaster@10.62.82.21:7077
15/02/11 14:44:02 WARN Remoting: Tried to associate with unreachable remote address [akka.tcp://sparkMaster@10.62.82.21:7077]. Address is now gated for 5000 ms, all messages to this address will be delivered to dead letters. Reason: Connection refused: no further information: /10.62.82.21:7077
应用程序有一个类使用以下行创建上下文
JavaSparkContext sc = new JavaSparkContext(new SparkConf().setAppName("Spark Count").setMaster("spark://10.62.82.21:7077"));
此 IP 是 spark 正在运行的机器的 IP。
然后我尝试使用以下行从 HDFS 读取文件
sc.textFile("hdfs://10.62.82.21/tmp/words.txt")
当我运行应用程序时,我得到了
【问题讨论】:
-
您是否为同一台机器配置了多个 IP?
-
其实我不知道,但是如果我使用域名而不是IP会抛出同样的异常。
-
触发 ifconfig 时会看到什么
-
我已经和系统管理员核实过,这台机器只有一个 IP。其实我怀疑Spark的安装。机器上正在运行一个 spark 进程(pgrep -f spark 使用进程 ID 回复)但是当我们启动 spark-shell 时,它会在显示一些异常后打开 scala shell。有没有办法确保正确安装火花?
-
打开外壳后会出现哪些异常?你正在连接到主人吗?
标签: hadoop apache-spark cloudera