【问题标题】:Handling Very Large volume(500TB) data using spark使用 spark 处理超大容量(500TB)数据
【发布时间】:2019-02-03 08:03:10
【问题描述】:

我有近 500TB 的大量数据,我必须对这些数据做一些 ETL。

此数据存在于 AWS S3 中,因此我计划使用 AWS EMR 设置来处理此数据,但我不确定应该选择什么配置。

  1. 我需要什么样的集群(主节点和多少从节点)?
  2. 我需要逐块处理(10GB)还是一次处理所有数据?
  3. RAM 和存储的主从(执行程序)内存应该是什么?
  4. 我需要什么样的处理器(速度)?

基于此,我想计算 AWS EMR 的成本并开始处理数据

【问题讨论】:

  • 没有人能回答这个问题。数据是什么?加工是什么?如果您的数据是 DNA 样本并且您的计算是“找到所有表达基因 X 的排列”,或者如果您的数据是日志文件并且计算是计算错误日志,那么您将得到非常不同的答案。即使我们知道这个和那个......只有模糊准确的猜测是:尝试前 100GB,如果可行,第一个 TB,然后扩展。
  • 这个问题太笼统了,答案也将基于假设。
  • 如果您在 AWS 中有 500TB,您应该与他们的 SA 之一保持良好的关系。如果没有,请打开包含更多具体细节的支持票。

标签: amazon-web-services apache-spark amazon-emr


【解决方案1】:

根据您的问题,您几乎没有使用 Hadoop 的经验。首先接受一些培训,以便了解 Hadoop 生态系统的工作原理。计划花费三个月的时间来达到入门级别。

您有很多选择要做,其中一些是项目成功的基础。例如,什么语言(Scala、Java 或 Python)?哪些工具(Spark、Hive、Pig 等)。您的数据采用什么格式(CSV、XML、JSON、Parquet 等)。是只需要批处理还是需要近实时分析等等等等。

您可能会发现其他更适用的 AWS 服务,例如 Athena 或 Redshift,具体取决于您的数据格式以及您尝试提取/处理的信息。

在 AWS 中有 500 TB 的数据,请开具支持的工单。解释你有什么,你想要什么以及你的时间框架。将有一个 SA 可以指导您前进。

【讨论】:

  • 我的数据是json数据,很多人建议我想用spark+yarn,所以我很困惑我需要什么样的集群。由于某些限制,我无法询问 SA
  • 重读我的答案。您需要向 SA 提供我询问的所有信息,以便他帮助您。 Spark+YARN 只是安装在 Hadoop 上的 Spark,这是一个正常的配置选项。如果您不知道自己在做什么(每 GB 0.09 美元),您的设计处理 500 TB 的错误可能会导致您损失 45,000 美元的数据传输费用。在继续之前,请先咨询 Hadoop 和 AWS 专家。
猜你喜欢
  • 1970-01-01
  • 2018-08-31
  • 2016-11-04
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多