【发布时间】:2022-01-06 12:24:00
【问题描述】:
我们正在一个基于 Tomcat 8.5 的 AWS EC2 实例 (CentOS) 上运行 Matillion (v1.54)。 到目前为止,我们已经开发了一些 ETL 作业,它们的执行需要相当长的时间(即长达数小时)。我们想加快工作的执行速度,我想知道如何识别瓶颈。
让我感到困惑的是m5.2xlarge EC2 实例(8 个 vCPU,32G RAM)和数据库(Snowflake)都不是很忙,而且似乎大部分时间都处于空闲状态(关于 CPU 和 RAM用法如top所示)。
我们的环境配置为使用多达 16 个并行连接。
我们还添加了 JVM 选项 -Xms20g -Xmx30g 到 /etc/sysconfig/tomcat8 以确保 JVM 获得足够的 RAM 分配。
我们的 Matillion 作业执行转换并加载到许多表中,其中大部分可以(并且应该)并行完成。我们仍然看到,大部分任务都是按顺序处理的。
我们如何增强它?
【问题讨论】:
标签: jvm snowflake-cloud-data-platform tomcat8 matillion