【发布时间】:2022-07-22 04:39:21
【问题描述】:
Databricks documentation 中的所有示例都使用 Scala。在 PySpark 中找不到如何使用此触发器类型。是否有等效的 API 或解决方法?
【问题讨论】:
标签: pyspark databricks spark-structured-streaming
Databricks documentation 中的所有示例都使用 Scala。在 PySpark 中找不到如何使用此触发器类型。是否有等效的 API 或解决方法?
【问题讨论】:
标签: pyspark databricks spark-structured-streaming
Python 实现错过了 Spark 3.2 版本,因此它将仅包含在 Spark 3.3 中(针对 OSS 版本)。在 Databricks 上,它作为 DBR 10.3(或 10.2?)的一部分发布,可按以下方式使用:
.trigger(availableNow=True)
【讨论】:
DataStreamWriter.trigger(*, processingTime: Optional[str] = None,
once: Optional[bool] = None,
continuous: Optional[str] = None,
availableNow: Optional[bool] = None) -> pyspark.sql.streaming.DataStreamWriter
availableNow:布尔型,可选
如果设置为 True,则设置一个触发器,以多批次处理所有可用数据,然后终止查询。只能设置一个触发器。
# trigger the query for reading all available data with multiple batches
writer = sdf.writeStream.trigger(availableNow=True)
【讨论】: