【发布时间】:2022-05-05 00:57:23
【问题描述】:
我有一个 Flink 作业,它在 Map 运算符中具有很大的状态。我们正在将具有大约 80GB 存储空间的保存点存储到 AWS S3。这个算子我们有大约 100 个并行度。但是,当我们从保存点恢复时,总会出现类似
的异常原因:java.io.InterruptedIOException: 无法在 s3a:/ 0 处打开 s3a://xxxx/UbfK/flink/savepoints/logjoin/savepoint-a9600e-39fd2cc07076/f9a31490-461a-42f3-88be-ec169145c35f:/ /adshonor-data-cube-test-apse1/UbfK/flink/savepoints/logjoin/savepoint-a9600e-39fd2cc07076/f9a31490-461a-42f3-88be-ec169145c35f:org.apache.flink.fs.s3base.shaded.com.amazonaws .SdkClientException:无法执行 HTTP 请求:等待池连接超时。
是否有配置参数来增加 Flink 中 AWS S3 的超时设置或其他方式来避免此错误?
【问题讨论】:
-
我们已经尝试修改 fs.s3a.connection.maximum 但它不起作用。超时错误仍然发生。我们最终通过减少每个taskmanager的slot号来临时解决这个问题。以前我们有一些大型任务管理器,它们有 30-40 个插槽。通过降级机器大小,将槽数减少到 8 个,增加任务管理器的数量,我们最终消除了超时错误。
标签: apache-flink flink-streaming