【问题标题】:GCP Dataflow, Dataproc, BigtableGCP 数据流、Dataproc、Bigtable
【发布时间】:2019-07-15 09:49:58
【问题描述】:

我正在选择服务来编写 JSON 消息并将其从 Cloud Pub/Sub 转换为 BigQuery,以用于 Google Cloud 上的数据管道。我想尽量减少服务成本。我还想以最少的人工干预来监控和适应大小不同的输入数据量。我该怎么办?

A.使用 Cloud Dataproc 运行您的转换。监控集群的 CPU 利用率。通过命令行调整集群中工作节点的数量。

B.使用 Cloud Dataproc 运行您的转换。使用诊断命令生成操作输出存档。定位瓶颈,调整集群资源。

C.使用 Cloud Dataflow 运行您的转换。使用 Stackdriver 监控作业系统延迟。使用工作程序实例的默认自动缩放设置。

D.使用 Cloud Dataflow 运行您的转换。监控作业样本的总执行时间。将作业配置为在需要时使用非默认 Compute Engine 机器类型。

【问题讨论】:

    标签: google-cloud-platform google-bigquery google-cloud-dataflow google-cloud-dataproc


    【解决方案1】:

    C!

    使用 pubsub 上的 Dataflow 来转换您的数据并将行写入 BQ。您可以直接从数据流监控 ETL 管道,并在顶部使用 stackdriver。 Stackdriver 也可用于启动事件等。

    使用自动扩缩功能可以最大限度地减少手动操作的数量。基本上,当这个解决方案设置正确时,它根本不需要工作。

    【讨论】:

    猜你喜欢
    • 2022-01-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-06-15
    • 1970-01-01
    • 1970-01-01
    • 2023-01-30
    • 2018-12-15
    相关资源
    最近更新 更多