【发布时间】:2019-02-08 21:21:25
【问题描述】:
我在 Windows 10 64 位机器上使用 Apache Spark。我已经安装了 Java、Python 3.6、spark-2.3.1-bin-hadoop2.7。 我正在使用 VSCode 编辑器进行 PySpark 编码。
当我使用 spark-submit 在 VSCode 中执行 Python spark 代码时,它正在显示
无法为您的平台加载 native-hadoop 库... 在适用的情况下使用内置 java 类
并且正在终止执行。
相关代码:
from pyspark import SparkContext, SparkConf
if name == "main":
conf = SparkConf().setAppName("word count").setMaster("local[2]")
sc = SparkContext(conf=conf)
lines = sc.textFile("in/word_count.text")
words = lines.flatMap(lambda line: line.split(" "))
wordcounts = words.countByValue()
for word, count in wordcounts.items():
print("{} : {}".format(word,count))
Spark 执行错误:
【问题讨论】:
-
请将您的代码和异常添加为文本而不是图像。此外,这只是一个警告,不会导致程序终止。如果您可以添加整个代码(假设它不是太大),那将很有帮助,minimal reproducible example。
-
嗨,我从 windows 命令提示符执行 pyspark 命令时收到相同的警告消息。
标签: apache-spark pyspark