【问题标题】:How to make Hadoop YARN faster with memory and vcore configuration?如何通过内存和 vcore 配置使 Hadoop YARN 更快?
【发布时间】:2015-05-03 17:26:31
【问题描述】:

在 Hadoop YARN 上,如果我有更多的容器来运行 map 任务或 reduce 任务,处理作业会变得更快吗?

因此,如果当我使容器分配内存小于默认值时这是真的,我可以让更多容器在主机上运行,​​并使工作更快。

那么 vcore 怎么样,我的意思是如果我们有更多的容器要运行,但它会根据 vcore 分配一个一个运行,对吗?也就是说,不管容器多还是少,还是一个接一个地运行。

【问题讨论】:

    标签: hadoop memory containers core hadoop-yarn


    【解决方案1】:

    不,任务可以并行运行。

    假设您的 YARN 集群有 24 个核心和 96 GB 内存。 mapreduce.map.cpu.vcoresmapreduce.reduce.cpu.vcores 的默认值为 1

    因此,您可以启动 24 个容器,每个容器具有 4 个 GM 内存,它们可以并行运行。如果您的工作需要超过 24 个容器,则最初会启动前 24 个任务,一旦所需资源(容器)可用,就会启动后续任务。

    【讨论】:

    • ooooo 我现在知道了,但我想再问一次。在相同 cpu vcore 的情况下,内存分配更大或更小的容器哪个运行得更快?
    • 对于 mapreduce,更大的容器意味着更少的 GC 周期。
    • 对不起,什么是 GC 周期?你更喜欢大容器还是小容器?非常感谢
    • @KennyBasuki 垃圾回收周期
    • 很抱歉,您能向我解释一下垃圾收集在 Hadoop 范式中的含义吗?非常感谢
    猜你喜欢
    • 1970-01-01
    • 2015-07-14
    • 1970-01-01
    • 1970-01-01
    • 2014-07-23
    • 2022-01-20
    • 1970-01-01
    • 1970-01-01
    • 2016-04-06
    相关资源
    最近更新 更多