【发布时间】:2012-05-11 06:29:55
【问题描述】:
我是 hadoop 的初学者。但我有一个有趣的观察。
在 hadoop 文档中使用the example,
通过在独立操作和伪分布式操作中运行相同的示例,独立操作用时不到 1 分钟,但伪分布式操作用时超过 3 分钟。这是很大的区别。我可以理解分布式模式下有额外的网络和调度开销。但似乎差别太大了。这可能不是真正的比较,因为示例非常简单。
我的问题是,在现实世界的工作中,独立模式和分布式模式之间有多大区别?
【问题讨论】:
-
伪分布式或独立模式都不打算在生产中使用,因此可能很难得到这个问题的有用答案。
标签: performance hadoop distributed