【发布时间】:2020-08-23 19:22:14
【问题描述】:
我想在默认运行 Python 3 的 Dataproc 集群中提交 PySpark 作业。我想用我拥有的虚拟环境初始化环境。
我尝试了两种方法, 一种是将整个 venv 压缩为存档并将其上传并提交到集群。但是我的工作无法找到依赖项。例如
gcloud dataproc jobs submit pyspark --project=** --region=** --cluster=** \
--archives gs://**/venv.zip#venv \
--properties spark.pyspark.driver.python=venv/bin/python \
gs://****.main.py
第二种方法是我试图告诉 spark 为我创建一个虚拟环境并安装链接中提到的提供给我的需求文件中的需求
但是这两种方法都失败了。任何人都可以帮忙吗? 另外,我不想采用 Dataproc 的后初始化脚本方式。我真的很想避免这种情况。
【问题讨论】:
标签: apache-spark google-cloud-platform pyspark google-cloud-dataproc