【发布时间】:2018-04-10 20:35:54
【问题描述】:
我在 amazon s3 中有大约 500GB 的压缩数据。我想将此数据加载到 Amazon Redshift。为此,我在 AWS Athena 中创建了一个内部表,并尝试将数据加载到 Amazon Redshift 的内部表中。
将这些大数据加载到 Amazon Redshift 需要一个多小时。问题是当我触发一个查询以加载数据时,它会在 1 小时后中止。我尝试了 2-3 次,但 1 小时后它就中止了。我正在使用 Aginity Tool 来触发查询。此外,在 Aginity 工具中,它显示查询当前正在运行并且加载器正在旋转。
更多详情: Redshift 集群有 12 个节点,每个节点有 2TB 空间,我使用了 1.7TB 空间。 S3 文件的大小不同。其中之一是 250GB。其中一些以 MB 为单位。
我正在使用命令
create table table_name as select * from athena_schema.table_name
它恰好在 1 小时后停止。
注意:我已将 Aginity 中的当前查询超时设置为 90000 秒。
【问题讨论】:
-
为什么要通过 Athena 而不仅仅是运行复制命令?
-
我同意 - 复制命令可能更快而且 - 更便宜!!无论如何 - 正好是 1 小时吗?你的红移集群有多大?你确定你有足够的空间吗?您的 s3 数据是否拆分为小文件?什么尺寸?它们的大小都一样吗?你到底在运行什么命令?如果您使用的是频谱 - 您使用的是什么 serde(可能显示您的表格定义)请尽可能多地回答上述问题并将此详细信息添加到您的问题中
-
@JonScott 我已经为这个问题添加了更多细节。谢谢。
-
s3 文件是否被压缩了?该查询是否包括 250GB 文件?
-
你需要把你的文件拆分更多,把那个 250GB 的文件分成 1000 个更小的文件
标签: amazon-web-services networking amazon-s3 amazon-redshift aginity