【问题标题】:Trigger.AvailableNow for Delta source streaming queries in PySpark (Databricks)Trigger.AvailableNow 用于 PySpark (Databricks) 中的 Delta 源流式查询
【发布时间】:2022-07-22 04:39:21
【问题描述】:

Databricks documentation 中的所有示例都使用 Scala。在 PySpark 中找不到如何使用此触发器类型。是否有等效的 API 或解决方法?

【问题讨论】:

    标签: pyspark databricks spark-structured-streaming


    【解决方案1】:

    Python 实现错过了 Spark 3.2 版本,因此它将仅包含在 Spark 3.3 中(针对 OSS 版本)。在 Databricks 上,它作为 DBR 10.3(或 10.2?)的一部分发布,可按以下方式使用:

    .trigger(availableNow=True)
    

    【讨论】:

      【解决方案2】:

      这里是official documentation

      DataStreamWriter.trigger(*, processingTime: Optional[str] = None, 
                                  once: Optional[bool] = None, 
                                  continuous: Optional[str] = None, 
                                  availableNow: Optional[bool] = None) -> pyspark.sql.streaming.DataStreamWriter
      

      availableNow:布尔型,可选

      如果设置为 True,则设置一个触发器,以多批次处理所有可用数据,然后终止查询。只能设置一个触发器。

      # trigger the query for reading all available data with multiple batches
      writer = sdf.writeStream.trigger(availableNow=True)
      

      【讨论】:

        猜你喜欢
        • 2020-11-18
        • 2021-10-13
        • 1970-01-01
        • 1970-01-01
        • 2021-10-20
        • 2020-11-17
        • 2021-09-29
        • 1970-01-01
        • 2022-08-02
        相关资源
        最近更新 更多