【发布时间】:2019-06-01 02:08:49
【问题描述】:
我有一个 aws ec2 p3.2xlarge 实例。我可以通过 ssh 轻松连接到它。然而大约 20 分钟后,当我在其上运行 keras 模型时,它会重置连接,并且我被踢出错误Connection reset by 54.161.50.138 port 22。然后我可以重新连接,但必须重新开始训练模型,因为我的进度丢失了。每次我连接到实例时都会发生这种情况。知道为什么会这样吗?
对于 ssh,我使用 gow,它可以让我在 Windows 上运行 linux 命令 - https://github.com/bmatzelle/gow/wiki 我在重置之前和之后检查了我的公共 IP 地址,它是相同的。 我还使用 amazon CloudWatch 查看了 CPU 使用率,这是正常的 - 20%。
【问题讨论】:
-
请参阅this post,但您需要有一些无需始终连接即可运行的东西。你能在后台运行你的程序吗?
-
您在家庭互联网上吗?如果是,请检查您的公共 IP 地址 (whatismyip.com)。重置后再次检查您的公共 IP 地址。还有两件事要检查,您的 ISP 可能会阻止长连接。您的家庭互联网路由器可能有问题。确保固件是最新的。你用什么软件做ssh?您的 ssh 客户端是否使用 Keep-Alives?使用更多信息编辑您的问题,否则我们只能猜测。
-
感谢您的回复。我认为保持连接处于活动状态不是问题,因为它会从另一端随机重置。你对如何在后台运行程序有什么建议吗?我只是从远程服务器终端运行一个 .py 文件。
-
我无法回答有关在后台运行 TensorFlow 的问题。我使用 TensorFlow 容器,然后使用浏览器连接到容器。这样我就不用担心设置、连接、后台进程等了。
-
如果你在你的 p2 上运行 tmux 或类似的,你可以从远程会话中分离并让会话运行然后重新连接,而不会让你的 ssh 隧道故障停止训练。
标签: amazon-web-services amazon-ec2 ssh