【发布时间】:2018-02-01 07:03:24
【问题描述】:
我想通过 Google Cloud Platform dataproc 运行 pyspark 作业,但我不知道如何设置 pyspark 以默认运行 python3 而不是 2.7。
我能找到的最好的就是添加这些initialization commands
但是,当我 ssh 进入集群时
(a)python命令还是python2,
(b) 由于 python 2 不兼容,我的工作失败了。
我已经尝试在我的 init.sh 脚本中卸载 python2 和别名 alias python='python3',但是很遗憾,没有成功。别名似乎没有保留。
我这样创建集群
cluster_config = {
"projectId": self.project_id,
"clusterName": cluster_name,
"config": {
"gceClusterConfig": gce_cluster_config,
"masterConfig": master_config,
"workerConfig": worker_config,
"initializationActions": [
[{
"executableFile": executable_file_uri,
"executionTimeout": execution_timeout,
}]
],
}
}
credentials = GoogleCredentials.get_application_default()
api = build('dataproc', 'v1', credentials=credentials)
response = api.projects().regions().clusters().create(
projectId=self.project_id,
region=self.region, body=cluster_config
).execute()
我的executable_file_uri 位于谷歌存储; init.sh:
apt-get -y update
apt-get install -y python-dev
wget -O /root/get-pip.py https://bootstrap.pypa.io/get-pip.py
python /root/get-pip.py
apt-get install -y python-pip
pip install --upgrade pip
pip install --upgrade six
pip install --upgrade gcloud
pip install --upgrade requests
pip install numpy
【问题讨论】:
标签: python-3.x configuration pyspark google-cloud-platform google-cloud-dataproc