【问题标题】:Performance comparison between hadoop Pseudo-Distributed Operation and Standalone Operationhadoop伪分布式操作和独立操作的性能比较
【发布时间】:2012-05-11 06:29:55
【问题描述】:

我是 hadoop 的初学者。但我有一个有趣的观察。

在 hadoop 文档中使用the example

通过在独立操作和伪分布式操作中运行相同的示例,独立操作用时不到 1 分钟,但伪分布式操作用时超过 3 分钟。这是很大的区别。我可以理解分布式模式下有额外的网络和调度开销。但似乎差别太大了。这可能不是真正的比较,因为示例非常简单。

我的问题是,在现实世界的工作中,独立模式和分布式模式之间有多大区别?

【问题讨论】:

  • 伪分布式或独立模式都不打算在生产中使用,因此可能很难得到这个问题的有用答案。

标签: performance hadoop distributed


【解决方案1】:

这些是相当不同的场景。在独立模式下,它永远不会启动正确的单节点 Hadoop 集群。一切都发生在本地,内联,在 JVM 中。数据甚至不必写入磁盘,可能。伪分布式操作是一个本地节点的最小“真实”Hadoop 安装。您必须将数据读/写到本地 HDFS 实例,生成另一个 JVM,等等。所有这些都会增加很多开销。也许开销确实是几分钟。这对我来说似乎完全明智。

【讨论】:

    【解决方案2】:

    Hadoop 框架用于处理 BIG DATA..

    所以数据的大小很重要,因为在传统文件系统中处理较小的文件会比在 hadoop 中更快,因为 hadoop mapreduce 框架有内部工作要做(使数据文件块并将其发送到数据节点并在处理从数据节点再次访问时)。因此对于较小的文件,hadoop框架不适合。

    来到独立和伪分布式模式,你应该考虑的一个方面是文件的大小,第二个方面是独立和伪分布式模式的实际差异。

    在独立模式下没有HDFS的概念,数据不会复制到hadoop分布式文件系统(显然节省时间)。而在伪分布式模式下,涉及的hdfs需要与需要处理的数据一起复制.

    小尺寸数据文件更适合使用传统文件处理,如果文件大小变得越来越大,hadoop 框架会提供更好的处理时间! 希望这会有所帮助!

    【讨论】:

    • 这需要认真编辑。将其分成段落并在适当的地方使用格式。
    猜你喜欢
    • 2023-03-25
    • 1970-01-01
    • 1970-01-01
    • 2019-02-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-12-04
    相关资源
    最近更新 更多