【发布时间】:2019-07-02 15:15:33
【问题描述】:
我有一个 Inception V3 模型,其中包含一些输入和输出修改部署到 Google Cloud ML Engine 以进行在线预测。在一周左右的时间里,我收到的稀疏请求相对较少(大约 130 个),中位延迟大约 100 毫秒,95% 的百分位数是 2000 毫秒。我已经生成了大约 2 个节点*小时。最小节点数设置为 0。这是我第一次想在生产中使用 Cloud ML Engine。
问题:
我知道节点在请求后几分钟就启动了。但是我如何估计会导致系统扩展的请求量,比如每 1 分钟?似乎没有关于节点 CPU 使用率的信息。
就我而言,我假设请求的数量会稳步增长。我是否应该期望 node*hours 达到大约 30*24(一个月中的天数小时数),然后在这个值上饱和一段时间,然后在预测节点的 CPU 利用率达到 70% 时进一步提高?
【问题讨论】:
标签: cpu-usage scaling google-cloud-ml price