【发布时间】:2020-01-24 08:39:15
【问题描述】:
现在,我通过轮询 job REST API 来监控我在 Google AI Platform(以前称为 ml 引擎)上提交的作业。我不喜欢这个解决方案有几个原因:
- 如果状态更改之间的间隔小于监控轮询率,则通常会延迟或完全错过对状态更改的感知
- 大量不必要的网络流量
- 大量不必要的函数调用
我希望在我的培训工作完成后立即收到通知。如果有某种方法可以分配钩子或回调以在作业状态更改时运行。
我还考虑直接在 AI Platform 上运行的训练任务 python 包中添加对云函数的调用。但是,我认为这些函数调用不会发生在训练作业意外关闭的情况下,例如当作业被 GCP 取消或强制结束时。
有没有更好的方法来解决这个问题?
【问题讨论】:
标签: google-cloud-platform google-cloud-ml gcp-ai-platform-training