【发布时间】:2020-04-17 08:45:30
【问题描述】:
我正在使用 Windows 10。我安装了 spark,目标是使用 pyspark。我做了以下步骤:
- 我已经使用 anaconda 安装了 Python 3.7 -- Python 已添加到
C:\Python37 - 我从this link 下载wintils -- winutils 添加到
C:\winutils\bin - 我下载了spark——提取的spark是:
C:\spark-3.0.0-preview2-bin-hadoop2.7 - 我从AdoptOpenJDK下载了Java 8
在系统变量下,我设置了以下变量:
-
HADOOP_HOME:C:\winutils -
SPARK_HOME:C:\spark-3.0.0-preview2-bin-hadoop2.7 -
JAVA_HOME:C:\PROGRA~1\AdoptOpenJDK\jdk-8.0.242.08-hotspot
最后,在系统路径下,我添加了:
- %JAVA_HOME%\bin
- %SPARK_HOME%\bin
- %HADOOP_HOME%\bin
在终端中:
所以我想知道为什么我会收到这个警告:
unable to load native-hadoop library... And why I couldn't bind on port 4040...
最后,在 Jupyter Notebook 中,尝试写入 Parquet 文件时出现以下错误。此图显示了一个工作示例,下图显示了有错误的代码:
这是我磁盘上的 DataMaster__3.csv:
还有 DaterMaster_par2222.parquet:
非常感谢任何帮助!
【问题讨论】:
标签: python apache-spark pyspark