【发布时间】:2020-12-30 07:08:56
【问题描述】:
我有一个包含两列(“time_stamp”和“ID”)的 Spark 数据框。
示例数据框:
**ID** **time_stamp**
1AB 2015-01-23 08:23:16
1AB 2015-01-23 08:54:40
25CD 2015-01-23 09:02:20
1AB 2015-01-23 10:15:36
1AB 2015-01-23 12:38:40
1AB 2015-01-24 08:25:16
1AB 2015-01-24 08:53:40
25CD 2015-01-24 09:01:20
1AB 2015-01-24 10:14:36
1AB 2015-01-24 12:30:40
如果时间戳与第一次出现的时间差小于 3 小时(保留最先出现的 ID),我想删除重复的 ID(保留第一次出现),如果差值大于 3 小时,我想保留 ID。
预期输出:
**ID** **time_stamp**
1AB 2015-01-23 08:23:16
25CD 2015-01-23 09:02:20
1AB 2015-01-23 12:38:40
1AB 2015-01-24 08:25:16
25CD 2015-01-24 09:01:20
1AB 2015-01-24 12:30:40
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql