【发布时间】:2023-03-22 13:44:02
【问题描述】:
我有一个我一直在研究的 Pig 脚本,它有一个来自 2 个不同数据源的内部联接。此连接恰好是第一个 MapReducing 导致操作。之前唯一的操作是过滤器和 foreachs。然后执行此 Join 时,一切都完美而快速地抛出了 map 阶段,但是当涉及到 reduce 阶段时,除了 1 之外的所有 reducer 都快速完成。然而,1 只是在阶段的 Reduce 部分以非常缓慢的速度处理数据。以至于等待 1 个减速器完成可能需要一个多小时以上的时间。我尝试增加减速器以及切换到倾斜连接,但似乎没有任何帮助。
任何关于事情的想法。
我还做了一个解释,看看我是否能看到任何东西,但这只是显示了一个简单的单一工作流程,没有什么了不起的。
【问题讨论】:
标签: hadoop mapreduce apache-pig