【问题标题】:Running TensorFlow trainer with Cloud ML Engine on TPU produces google.rpc.QuotaFailure在 TPU 上使用 Cloud ML Engine 运行 TensorFlow 训练器会产生 google.rpc.QuotaFailure
【发布时间】:2018-06-06 18:35:07
【问题描述】:

我使用scaleTier: BASIC 在 Cloud ML Engine 上开发了一个 TensorFlow 模型。

使用scaleTier: BASIC_GPU 在 GPU 上实验性地运行它的训练器可以正常工作。但是尝试使用 scaleTier: BASIC_TPU 在 TPU 上运行它会产生以下错误消息:

type.googleapis.com/google.rpc.QuotaFailure
The request for 1 TPU_V2 accelerators exceeds the allowed maximum
of 30 K80, 30 P100.

这个限制来自哪里,可以取消吗?通过启用另一个 API 或增加我的初始预算?

【问题讨论】:

    标签: tensorflow gpu google-cloud-ml google-cloud-tpu


    【解决方案1】:

    作为announced at Google Cloud Next '18,Cloud TPU 现在是available to everyone,没有白名单。

    要为 Cloud ML Engine 启用它们,请转到此处:

    https://cloud.google.com/ml-engine/docs/tensorflow/using-tpus

    ...向下滚动到“授权您的 Cloud TPU 访问您的项目”标题,然后按照那里的说明进行操作。简而言之,您需要向您创建的 TPU 提供资源的 IAM 访问权限。

    【讨论】:

      【解决方案2】:

      我尝试了同样的事情并得到了同样的结果。该文档暗示 TPU 可供所有人使用,但事实并非如此。据我所知,您必须specially request TPU 访问(我填写了请求但没有得到回复)。

      【讨论】:

      • 是的,这也是我的初步结论。
      • 1. Cloud ML Engine TPU 处于 Alpha 阶段,它只是白名单。如果您想尝试一下,请通过 cloudml-feedback@google.com 与我们联系。 2. Cloud TPU 是一个不同的产品,它有自己的 TPU alpha。两种产品都提供 TPU。 Cloud ML Engine 提供托管服务,而 Cloud TPU 提供带有 TPU 的原始 VM。
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2018-03-24
      • 2020-05-14
      • 2019-03-30
      • 1970-01-01
      • 2019-08-06
      • 2019-08-02
      • 1970-01-01
      相关资源
      最近更新 更多