【发布时间】:2019-02-03 08:03:10
【问题描述】:
我有近 500TB 的大量数据,我必须对这些数据做一些 ETL。
此数据存在于 AWS S3 中,因此我计划使用 AWS EMR 设置来处理此数据,但我不确定应该选择什么配置。
- 我需要什么样的集群(主节点和多少从节点)?
- 我需要逐块处理(10GB)还是一次处理所有数据?
- RAM 和存储的主从(执行程序)内存应该是什么?
- 我需要什么样的处理器(速度)?
基于此,我想计算 AWS EMR 的成本并开始处理数据
【问题讨论】:
-
没有人能回答这个问题。数据是什么?加工是什么?如果您的数据是 DNA 样本并且您的计算是“找到所有表达基因 X 的排列”,或者如果您的数据是日志文件并且计算是计算错误日志,那么您将得到非常不同的答案。即使我们知道这个和那个......只有模糊准确的猜测是:尝试前 100GB,如果可行,第一个 TB,然后扩展。
-
这个问题太笼统了,答案也将基于假设。
-
如果您在 AWS 中有 500TB,您应该与他们的 SA 之一保持良好的关系。如果没有,请打开包含更多具体细节的支持票。
标签: amazon-web-services apache-spark amazon-emr