【发布时间】:2020-05-28 17:48:22
【问题描述】:
我们的 DAG 中的任务经常失败,在关注 Google 的 troubleshooting steps 之后,我发现根本原因是由于内存不足导致的内存驱逐。
这与我在 Composer Monitoring 选项卡中的每个节点的内存利用率图中看到的一致。我们的机器支持 8 GB 节点,最大峰值为 16 GB。
Screen shot of memory utilization per node graph, which shows memory spikes
我遇到的困难是确定哪些 DAG 导致了内存峰值。 (我的假设是“DAG A”可能导致内存峰值导致“DAG B”被驱逐)。我想重新审视一下代码,看看是否可以在增加机器大小之前对其进行优化。
如何连接这些点以了解给定 Kubernetes 节点在给定时间正在处理哪些任务?
【问题讨论】:
标签: airflow google-kubernetes-engine google-cloud-composer