【问题标题】:Hadoop, Hive, Pig, HBase, Cassandra - when to use what? [closed]Hadoop、Hive、Pig、HBase、Cassandra——什么时候用什么? [关闭]
【发布时间】:2014-02-21 17:24:16
【问题描述】:

首先,我对大数据和 Hadoop 世界还比较陌生,而且我刚刚开始对 Hortonworks Sandbox(目前为止的 Pig 和 Hive)进行了一些试验。 我想知道在哪些情况下我可以使用上面提到的 Hadoop、Hive、Pig、HBase 和 Cassandra 工具?

在我的沙盒环境中,Hive 和 Pig 的文件只有 9MB,响应时间为几秒到几分钟。这显然在某些情况下不可用,例如 Web 应用程序(除非它是其他东西,例如我的虚拟机设置)。

我对正确用法的猜测是:

  • Hadoop:只是其余部分的技术基础,只有极少数可以直接使用的用例
  • Hive 或 Pig:用于每小时或每天运行一次的分析过程
  • HBase 或 Cassandra:适用于需要 100 毫秒或更短响应时间的实时应用程序(例如 Web 应用程序)

此外,什么时候使用 HBase 而不是什么时候使用 Cassandra?

谢谢!

【问题讨论】:

    标签: hadoop cassandra hive apache-pig


    【解决方案1】:

    你的猜测有些准确。

    通过 Hadoop,我猜您指的是 MapReduce? Hadoop 本身就是一个由许多组件(包括 MapReduce、HDFS、Pig 和 Hive)组成的生态系统。

    当您需要在 Map() 和 Reduce() 方法级别编写处理数据的逻辑时,MapReduce 非常有用。在我的工作中,我发现 MapReduce 在处理非结构化和需要清理的数据时非常有用。

    Hive,Pig:它们适用于批处理,定期运行(可能以数小时或数天计)

    HBase 和 Cassandra:支持低延迟调用。因此它们可用于响应时间是关键的实时应用程序。查看this discussion 以更好地了解 HBase 与 Cassandra。

    【讨论】:

    • 我认为 Hadoop 是指 HDFS,因为 Hive、Pig 和 HBase 主要使用 HDFS 作为它们的文件系统。
    猜你喜欢
    • 2012-12-04
    • 2015-03-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-10-17
    • 1970-01-01
    • 2010-09-20
    相关资源
    最近更新 更多