【发布时间】:2017-07-25 00:18:06
【问题描述】:
我目前正在尝试使用 Facenet(用于人脸识别的 Tensorflow 库)提交关于 Google Cloud ML 的工作培训。我目前正在尝试这个 (link is here) 库的一部分,它对模型进行训练。
转到 Google Cloud ML,我正在关注本教程 (link is here) ,它会教您如何提交培训。
我能够成功地向 Google Cloud ML 提交工作培训,但出现了错误。 以下是一些错误图片:
这是来自 Google Cloud Jobs 日志的错误
这里有更多关于 Google Cloud Job 日志的详细图片
提交作业请求是成功的,它甚至在等待 Tensorflow 启动,但之后就出现了该错误。
我用来运行它的命令在这里:
gcloud ml-engine jobs submit training facetraining_test4 \
--package-path=/Users/myname/Documents/projects/tf-projects/facenet/src/ \
--module-name=/Users/myname/Documents/projects/tf-projects/facenet/src/facenet_train_classifier.py \
--staging-bucket=gs://facenet-training-test \
--region=asia-east1 \
--config=/Users/myname/Documents/projects/tf-projects/facenet/none_config.yml \
-- \
--logs_base_dir=/Users/myname/Documents/projects/tf-projects/logs/facenet/ \
--models_base_dir=/Users/myname/Documents/projects/tf-projects/models/facenet/ \
--data_dir=/Users/myname/Documents/projects/tf-projects/facenet_datasets/employee_dataset/employee/employee_maxpy_mtcnnpy_182/ \
--image_size=160 \
--model_def=models.inception_resnet_v1 \
--lfw_dir=/Users/myname/Documents/projects/tf-projects/facenet_datasets/lfw/lfw_mtcnnpy_160/ \
--optimizer=RMSPROP \
--learning_rate -1 \
--max_nrof_epochs=80 \
--keep_probability=0.8 \
--learning_rate_schedule_file=/Users/myname/Documents/projects/tf-projects/facenet/data/learning_rate_schedule_classifier_casia.txt \
--weight_decay=5e-5 \
--center_loss_factor=1e-4 \
关于如何解决此问题的任何建议?谢谢!
【问题讨论】:
-
如果您转至console.cloud.google.com/mlengine/jobs,您将看到作业列表和日志链接。在那里查找错误并报告您发现的内容。
-
您确定没有在训练脚本结束时返回非零状态代码吗?如果没有,我只需将一些日志记录语句添加到您的 .py 文件中,然后检查 console.cloud.google.com/mlengine/jobs 中的日志以了解您的工作崩溃的位置。
-
@rhaertel80 我添加了更多图片以便更详细地查看错误。
-
@AmirHormati 我对 Google Cloud ML 还是很陌生。我很难理解这些错误。我添加了图片以更详细地查看错误。如果你能帮助我理解错误,那就太好了!
-
@Mikebarson 你有可以在 Cloud ML 上运行的重构版本吗?
标签: tensorflow google-cloud-ml google-cloud-ml-engine