【发布时间】:2020-04-09 20:45:42
【问题描述】:
我正在运行 EMR 笔记本(平台:AWS,笔记本:jupyter,内核:PySpark)。
我需要安装一个 .jar 依赖项 (sparkdl) 来处理一些图像。
使用 Spark-submit,我可以使用:
spark-submit --packages databricks:spark-deep-learning:1.5.0-spark2.4-s_2.11
使用本地笔记本,我可以使用:
spark = (SparkSession
.config('spark.jars.packages', 'databricks:spark-deep-learning:1.5.0-spark2.4-s_2.11')
.getOrCreate()
)
但是如何在 EMR 笔记本上做同样的事情呢?
- 我可以使用引导程序在每个节点上安装它。但我不知道该怎么做……
- 我可以配置 SparkSession 以使用依赖项。但是笔记本似乎无法访问存储库……而且我不知道让它加载复制到 S3 存储桶上的文件的语法……
编辑: 我试过了
%%configure -f
{ "conf":{
"spark.jars": "s3://p8-fruits/libs/spark-deep-learning-1.5.0-spark2.4-s_2.11.jar"
}
}
这没有引发任何错误,但我仍然无法使用它。当我尝试import sparkdl 时,我得到了ModuleNotFoundError: No module named 'sparkdl'。
非常感谢您的帮助!
【问题讨论】:
-
这个帖子可能有帮助:stackoverflow.com/questions/27698111/…
标签: pyspark jupyter-notebook dependencies amazon-emr