【问题标题】:Luminoth: Duration of default Google Cloud ML training job with voc2012Luminoth:使用 voc2012 进行默认 Google Cloud ML 训练作业的持续时间
【发布时间】:2017-11-09 11:19:47
【问题描述】:

我使用luminoth(从 GIT 签出)和默认设置、数据集 voc2012(转换并上传到存储桶)和 sample_config.yml

这项工作大约需要多长时间?因为我让它运行了——但现在它已经运行了 40 多小时,但仍未完成!?

还是我必须手动停止?

【问题讨论】:

    标签: python tensorflow deep-learning google-cloud-ml


    【解决方案1】:

    从source code 看来,luminoth 一直在训练,直到您停止它(本地是 ctrl-c;在云端,手动取消作业)。

    我想这个想法是在训练时监控 tensorboard,并在它看起来不错时手动停止它。

    【讨论】:

    • 感谢@rhaertel80,我可以使用张量板进行监控吗?我只知道如何将它用于本地工作..
    • 以完全相同的方式运行 tensorboard(例如在本地机器上),但将输出目录设置为您指定的 GCS 位置(可能是您设置为 --job-dir 的位置)
    • 是的,我已经尝试过:tensorboard --logdir gs://path/to/job ..但它会导致异常“tensorflow.python.framework.errors_impl.UnimplementedError: File system scheme gs not实施”
    • 您是如何安装 TensorFlow 的。有一个选项可以在 GCS 支持中编译。如果您 p​​ip install 它,我认为默认情况下它是打开的,但我不确定。如果从源代码编译,则必须在配置期间选择该选项,因为默认情况下它是关闭的。
    • 从您链接的 GitHub 问题中,听起来 GCS 支持在 Windows 上不起作用(可能是因为它需要 libcurl)。在 Windows 上,您将无法使用 gsutil 定期下载文件。如果您可以访问 Ubuntu,那就更好了。
    猜你喜欢
    • 2018-04-22
    • 2017-03-09
    • 2018-10-28
    • 2019-03-20
    • 1970-01-01
    • 1970-01-01
    • 2017-11-09
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多