【问题标题】:Apache beam pubsub to bigquery schema creationApache Beam pubsub 到 bigquery 模式创建
【发布时间】:2019-07-14 15:18:22
【问题描述】:

我的流束/数据流管道正在通过 pub/sub 从另一个服务一个接一个地接收基于事件的数据。为了确保对上游数据结构进行更改的任何人都不会破坏管道,我在每个元素上运行以下代码:

class CreateLoadsTableRow(beam.DoFn):
  def process(self, element):
    row = {
      'event_id': element.get('load_id'),
      'domain': element.get('url'),
      'user_data': {
        'event_id': element.get('events'),
      }
      # Loads more keys below
    }
    yield row

我担心这会非常昂贵 - 有没有更有效的方法来实现这一点?

或者有没有更好的模式?

【问题讨论】:

    标签: python google-bigquery google-cloud-dataflow apache-beam


    【解决方案1】:

    答案与解析每个元素的 JSON 基本相同:Apache beam parsing data flow pub/sub into a dictionary。简而言之 - 这段代码本身可能不会成为问题。

    【讨论】:

    • 这不是我的问题,我知道这段代码不是问题——我在问是否有更有效的方法来实现这一点。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2021-05-23
    • 2018-12-07
    • 2021-02-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多