【发布时间】:2020-01-23 04:11:25
【问题描述】:
我想使用深度学习对数据进行建模,因此我尝试从存储在 s3 中的数据(即 parquet 格式)中加载 EC2 实例(p2.8xlarge)中的数据,s3 中 parquet 文件夹的大小为 9 GB,我我正在使用 pyarrow 从 s3 加载镶木地板数据,但加载该数据大约需要 3 小时,我想在 10-15 分钟到一个小时内减少它。 任何帮助将不胜感激。谢谢
【问题讨论】:
-
instance和s3是否在同一个区域?以及您使用的是哪种实例类型?
-
是的,它们在同一个区域,parquet大小是压缩后的大小,解压后大于50 GB,我使用的实例类型是p2.8xlarge
-
您当前的实例带宽是
10GB如果您需要高网络性能,那么您需要网络优化实例。 -
EC2 到 S3 – 进出 Amazon Simple Storage Service (S3) 的流量现在可以利用高达 25 Gbps 的带宽。以前,这种类型的流量可以访问 5 Gbps 的带宽。这对于在 S3 中访问大量数据或使用 S3 进行备份和恢复的应用程序很有用。aws.amazon.com/blogs/aws/…
-
谢谢,如果我使用网络优化实例,我将能够在有限的时间内获取数据,您能否推荐一些网络优化实例,这真的很有帮助。
标签: amazon-web-services amazon-s3 amazon-ec2 parquet pyarrow