【发布时间】:2020-02-26 22:47:59
【问题描述】:
在 sagemaker jupyter notebook 中,我运行以下代码从 s3 存储桶加载数据。
import boto3
import pandas as pd
from sagemaker import get_execution_role
role = get_execution_role()
bucket='bucketname'
data_key = 'filename'
data_location = 's3://{}/{}'.format(bucket, data_key)
data=pd.read_csv(data_location)
然后内核死了,我得到一个弹出窗口说“内核似乎已经死了。它将自动重新启动。”
有没有一种简单的方法可以在 sagemaker 中从 s3 加载数据?
【问题讨论】:
-
文件有多大?
-
不到 2 GB @BrianJoseph
-
嗯,这相当大。它可能有很多东西,但对于 jupyter 来说可能行太多了。尝试按块加载数据并一次处理 1 个块:
for chunk in pd.read_csv(<filepath>, chunksize=<your_chunksize_here>) -
感谢您的回复,但没有更简单的方法吗? sagemaker 的要点之一难道不是我不必跨越障碍即可处理大量数据吗?
-
您的笔记本使用哪种实例类型?你能试试更大的吗?此外,对于大于内存的数据,请考虑使用 Dask。
标签: python amazon-s3 jupyter-notebook amazon-sagemaker