【发布时间】:2019-08-02 03:10:53
【问题描述】:
我在 Jupyter 上创建了一个适合学习/模型的笔记本,并且在过去的一年里一直在我的游戏笔记本电脑上使用它,几乎没有问题。
由于我现在将训练数据集增加 10 倍,因此我想将 Jupyter 笔记本移动到 AWS Sagemaker,这样它就可以提供额外的马力,这样我就不必将笔记本电脑留在办公桌上在训练完成之前打开一个不可用的。
我创建了 Sagemaker 实例,并打开了 Jupyter 笔记本。使用在我的笔记本电脑上运行了 3 小时的代码和原始数据,我尝试在笔记本电脑中运行单元,以获得总时间,这样我就可以为更大的运行选择正确的硬件场景。
每次我尝试运行笔记本时,都会导致浏览器崩溃。我在 Windows 10 和 Ubuntu 16.04 笔记本电脑上都尝试过 Chrome 和 Firefox。
我不知道如何做两件我认为可能会有所帮助的事情。
1) 查看 jupyter notebook 服务器代码日志。我创建了生命周期创建/启动脚本,然后查看通过 Cloudwatch 创建的日志,与那里的崩溃无关。
2)查看浏览器内的日志。我在两者上都打开了开发者模式,但是一旦它因“Aw snap”等而崩溃,我就不能再在窗口中做任何事情,所以我看不到任何输出。
这是尝试运行的一段代码。我已经尝试过 show_metric=True 和 False:
from datetime import datetime
start_time=datetime.now().strftime("%Y-%m-%d %H:%M")
tf.reset_default_graph()
# Build neural network
phr_net = tflearn.input_data(shape=[None, len(phr_train_x[0])])
phr_net = tflearn.fully_connected(phr_net, 8)
phr_net = tflearn.fully_connected(phr_net, 8)
phr_net = tflearn.fully_connected(phr_net, len(phr_train_y[0]), activation='softmax')
phr_net = tflearn.regression(phr_net)
# Define model and setup tensorboard
phr_model = tflearn.DNN(phr_net, tensorboard_dir='phr_tflearn_logs')
# Start training (apply gradient descent algorithm)
phr_model.fit(phr_train_x, phr_train_y, n_epoch=EPOCH_RUN_LENGTH, batch_size=8, show_metric=True)
phr_model.save('model.phr_tflearn')
print("start: ", start_time, "end: ", datetime.now().strftime("%Y-%m-%d %H:%M"))
我是一名优秀的谷歌用户,但没有找到任何帮助。 AWS 文档只是让我绕圈子。有人有什么建议吗?
【问题讨论】:
-
AWS 文档的哪一部分不清楚?如果您可以指出我们,我们可以改进它。谢谢。
标签: amazon-web-services google-chrome tensorflow firefox jupyter-notebook