【发布时间】:2018-10-16 03:27:34
【问题描述】:
我正在使用带有 AWS Sagemaker 的 p2 实例上随 Docker 映像一起运行的自定义算法(有点类似于 https://github.com/awslabs/amazon-sagemaker-examples/blob/master/advanced_functionality/scikit_bring_your_own/scikit_bring_your_own.ipynb)
在训练过程结束时,我尝试将我的模型写到输出目录,该目录通过 Sagemaker 挂载(如教程中所示),如下所示:
model_path = "/opt/ml/model"
model.save(os.path.join(model_path, 'model.h5'))
不幸的是,随着时间的推移,模型显然变得太大了,我得到了 以下错误:
RuntimeError:关闭文件时出现问题(文件写入失败:时间 = Thu Jul 26 00:24:48 2018
00:24:49,文件名 = 'model.h5',文件描述符 = 22,errno = 28, 错误消息 = '设备上没有剩余空间',buf = 0x1a41d7d0,总计 写[...]
所以我所有的 GPU 时间都被浪费了。我怎样才能防止这种情况再次发生?有谁知道我存储在 Sagemaker/mounted 目录中的模型的大小限制是多少?
【问题讨论】:
-
您能否提供更多关于
model的确切对象类型的信息?如果是 MXNet 模型,使用 save method 直接将其保存到 S3 存储桶可能是有意义的。
标签: amazon-web-services keras amazon-sagemaker