【发布时间】:2020-12-02 12:50:16
【问题描述】:
我有一个 spark 结构化流式作业,它从 cassandra 和 deltalake 读取映射表并与流式 df 连接。我想了解这里的确切机制。 Spark 是否会在每个微批处理周期中命中这些数据源(cassandra 和 deltalake)?如果是这种情况,我在 spark web ui 中看到这些表只读取一次。 请帮助我理解这一点。 提前致谢
【问题讨论】:
-
显示代码,显示代码
-
我可以对语句的流程做一个非常简要的概述 1) 从 kafka 主题中读取流数据 2) 读取 cassandra 表 3) 加入上述 2 个 dfs 4) 写入另一个主题
标签: apache-spark pyspark spark-streaming spark-structured-streaming