【发布时间】:2015-01-13 10:37:57
【问题描述】:
我在我的项目中使用大数据来处理我的 ETL 执行所需的操作时间。
我想了解 CloudEra Impala 框架是内存密集型的,因为它返回结果的速度非常快,而且比 hive 和 Pig 快得多。
我有一个包含 20-3000 万条记录的数据集,我执行了一个 impala 查询操作,例如 group by 和 joins
所以你建议使用 impala,因为它更快还是使用 hive。我的全部意图是压缩我现在使用 Oracle 的 ETL 操作时间..
请就内存使用提出建议,是否推荐...
此外,如果有任何链接可以帮助我们了解 Impala 的工作原理以及它如何使用其内存,将会有很大帮助。
谢谢。!!!!!!
【问题讨论】:
标签: hadoop hive apache-pig bigdata impala