【发布时间】:2015-03-16 10:07:03
【问题描述】:
我正在尝试了解如何构建大数据解决方案。我有 400TB 数据的历史数据,每小时插入 1GB 数据。
由于数据是机密的,我正在描述示例场景,数据包含银行分行中所有活动的信息。每小时,当新数据插入(不更新)到 hdfs 时,我需要找出有多少贷款关闭、贷款创建、帐户过期等(大约 1000 次要执行的分析)。分析涉及处理整个 400TB 的数据。
我的计划是使用 hadoop + spark。但有人建议我使用 HBase。通读所有文件,我无法找到明显的优势。
处理将增长到 600TB 的数据的最佳方式是什么
1. 用于分析的 MR 和用于查询的 impala/hive
2. 用于分析和查询的 Spark
3. HBase + MR 用于分析和查询
提前致谢
【问题讨论】:
-
Spark是分布式计算框架,HBase是no-sql数据库。对我来说,选择其中一个似乎是荒谬的。
-
@DanielDarabos 是的,我明白.. 我试图弄清楚使用 HBase 而不是 HDFS 的优势是什么。当需要对整个数据集执行操作时,HBase 是否良好
-
我认为 HBase 的优势在于支持更新。既然你没有更新,那么支持 HBase 的论据是什么?
标签: hadoop apache-spark hbase