【发布时间】:2016-01-13 10:46:08
【问题描述】:
假设一个hadoop集群有3个slave节点和一个master节点,复制因子为2。进一步假设一个文件F被分成3个块A、B和C,它们存储如下: 从站 1:A、B 从站 2:A、C 从站 3:B、C
此外,假设您启动 map reduce 作业来计算 F 中的单词数,并且每个块被拆分 3 次。
我的问题是如何分配映射器以便优化它们以实现最大生产力?一种可能: 从属 1:3 个映射器在 A 上工作 从属 2:3 个映射器在 C 上工作 从属 3:3 个映射器在 B 上工作
但是hadoop如何避免以下情况呢? 从站 1:6 个映射器(A 上 3 个,B 上 3 个) 从站 2:空闲 从属 3:C 上的 3 个映射器
【问题讨论】: