【发布时间】:2021-07-22 01:54:44
【问题描述】:
我有一个记录类似于以下的表
| order_id | order_balance |
|---|---|
| 34 | 400 |
| 35 | 200 |
| 36 | 100 |
一旦插入 order_id,即 order_id = 34。当 order_balance 更改时,不会插入新记录(不是追加),余额本身会在同一记录中更新。所以说order_id=34 的余额明天变为300。当你明天看表时。
order_id = 34 的记录如下所示:
| order_id | order_balance |
|---|---|
| 34 | 300 |
所以我想建立一个表来跟踪新插入的 order_ids 和 order_balances,或者在最后一天(或时间段,可能是小时、天、分钟等)发生余额变化.我正在使用 pyspark 和 spark sql。
我的第一个想法是创建一个表格来记录昨天的余额,然后将它们与今天的余额进行比较。但是,这将是 spark 作业的两次单独运行,并且需要我在 spark 中的作业运行之间保留该表。这甚至可能吗?
【问题讨论】:
-
根据问题指南,请展示您的尝试并告诉我们您发现了什么(在本网站或其他地方)以及为什么它不能满足您的需求。
-
SQL Server SQLite - 请更正您的标签。
-
还要注意表格格式代码。
-
顺便说一句-您熟悉“接受”答案吗?我注意到你还没有接受任何东西。
-
您好,感谢您的 cmets,我已经更正了我的标签,并添加了我对如何继续进行的初步思考过程。我还没有接受答案,因为我的问题略有改变,我还没有找到答案。
标签: sql apache-spark-sql batch-processing