【发布时间】:2015-11-27 08:39:44
【问题描述】:
我们目前正在为非技术用户使用 ETL 工具(通过 Hadoop),以便他们使用原始数据创建 csv 文件。开发人员根据需要为他们创建一个流程,并根据需要运行它。由于我们使用数据湖文件 (S3) 来创建输出,因此我们需要将所有事实连接在一起并运行一些 Hadoop 需要一段时间才能完成的繁重作业。
我们希望这些进程在更短的时间内运行。我的想法是使用 UNLOAD 命令来实现这个任务的红移。由于 redshift 中的数据已经根据业务需求构建,因此通常是一个非常简单的查询来获取他们想要的内容,运行时间为 2-5 分钟。
但是,我不确定是否让我们的用户选择按需运行卸载命令(不是由他们自己,通过构建的进程),是否可能会对 redshift 造成压力。
谁能提供一些这方面的信息。我们预计每天 2-4 分钟大约有 20 个查询。
谢谢
尼尔
【问题讨论】:
标签: hadoop amazon-s3 data-warehouse amazon-redshift