【问题标题】:Jupyter notebook in sagemaker kernel keeps dying when I try to load data from s3当我尝试从 s3 加载数据时,sagemaker 内核中的 Jupyter 笔记本一直死机
【发布时间】:2020-02-26 22:47:59
【问题描述】:

在 sagemaker jupyter notebook 中,我运行以下代码从 s3 存储桶加载数据。

import boto3
import pandas as pd
from sagemaker import get_execution_role

role = get_execution_role()
bucket='bucketname'
data_key = 'filename'
data_location = 's3://{}/{}'.format(bucket, data_key)

data=pd.read_csv(data_location)

然后内核死了,我得到一个弹出窗口说“内核似乎已经死了。它将自动重新启动。”

有没有一种简单的方法可以在 sagemaker 中从 s3 加载数据?

【问题讨论】:

  • 文件有多大?
  • 不到 2 GB @BrianJoseph
  • 嗯,这相当大。它可能有很多东西,但对于 jupyter 来说可能行太多了。尝试按块加载数据并一次处理 1 个块:for chunk in pd.read_csv(<filepath>, chunksize=<your_chunksize_here>)
  • 感谢您的回复,但没有更简单的方法吗? sagemaker 的要点之一难道不是我不必跨越障碍即可处理大量数据吗?
  • 您的笔记本使用哪种实例类型?你能试试更大的吗?此外,对于大于内存的数据,请考虑使用 Dask

标签: python amazon-s3 jupyter-notebook amazon-sagemaker


【解决方案1】:

很可能您创建的笔记本实例太小。大多数人使用ml.t2.medium 进行演示,但可能需要ml.t2.large 或更高版本。

请记住,t2 是第二代,AWS 保证后续代 (t3)至少与上一代一样具有成本效益。 IE。使用ml.t3.mediumml.t3.large

【讨论】:

    【解决方案2】:

    我遇到了同样的问题,联系 AWS 客服增加实例。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-07-31
      • 2018-11-19
      • 2022-06-16
      • 1970-01-01
      • 2021-08-12
      • 2019-08-01
      • 1970-01-01
      相关资源
      最近更新 更多