【发布时间】:2016-06-20 12:36:58
【问题描述】:
我正在尝试读取我的 hdfs 中的文件。这是我的hadoop文件结构的展示。
hduser@GVM:/usr/local/spark/bin$ hadoop fs -ls -R /
drwxr-xr-x - hduser supergroup 0 2016-03-06 17:28 /inputFiles
drwxr-xr-x - hduser supergroup 0 2016-03-06 17:31 /inputFiles/CountOfMonteCristo
-rw-r--r-- 1 hduser supergroup 2685300 2016-03-06 17:31 /inputFiles/CountOfMonteCristo/BookText.txt
这是我的 pyspark 代码:
from pyspark import SparkContext, SparkConf
conf = SparkConf().setAppName("myFirstApp").setMaster("local")
sc = SparkContext(conf=conf)
textFile = sc.textFile("hdfs://inputFiles/CountOfMonteCristo/BookText.txt")
textFile.first()
我得到的错误是:
Py4JJavaError: An error occurred while calling o64.partitions.
: java.lang.IllegalArgumentException: java.net.UnknownHostException: inputFiles
这是因为我的 sparkContext 设置不正确吗?我通过虚拟盒在 ubuntu 14.04 虚拟机中运行它。
我不确定我在这里做错了什么......
【问题讨论】:
标签: apache-spark hdfs pyspark