【问题标题】:How to find consecutive rows based on the value of a column?如何根据列的值查找连续的行?
【发布时间】:2013-08-26 04:43:55
【问题描述】:

我有一些数据。我想根据data 列的值对它们进行分组。如果有 3 个或更多连续行的数据大于 10,那么这些行就是我想要的。

所以对于这个数据:

use tempdb;
go
set nocount on;

if object_id('t', 'U') is not null
drop table t;
go

create table t
(
    id int primary key identity,
    [when] datetime,
    data int
)
go

insert into t([when], data) values ('20130801', 1);
insert into t([when], data) values ('20130802', 121);
insert into t([when], data) values ('20130803', 132);
insert into t([when], data) values ('20130804', 15);
insert into t([when], data) values ('20130805', 9);
insert into t([when], data) values ('20130806', 1435);
insert into t([when], data) values ('20130807', 143);
insert into t([when], data) values ('20130808', 18);
insert into t([when], data) values ('20130809', 19);
insert into t([when], data) values ('20130810', 1);
insert into t([when], data) values ('20130811', 1234);
insert into t([when], data) values ('20130812', 124);
insert into t([when], data) values ('20130813', 6);

select * from t;

我想要的是:

id          when                    data       
----------- ----------------------- -----------
2           2013-08-02 00:00:00.000 121        
3           2013-08-03 00:00:00.000 132        
4           2013-08-04 00:00:00.000 15         
6           2013-08-06 00:00:00.000 1435       
7           2013-08-07 00:00:00.000 143        
8           2013-08-08 00:00:00.000 18         
9           2013-08-09 00:00:00.000 19    

怎么做?

【问题讨论】:

  • 我认为您的输出错误。 15、9、1435,都在10以上怎么样。
  • "consecutive" 要求对行进行排序。所以我的意思是“连续”是首先按 id 对所有行进行排序,然后使用排序结果作为“连续”的基础。
  • 对于“15, 9, 1435”,9 小于 10。

标签: sql sql-server tsql sql-server-2005


【解决方案1】:

试试这个

WITH cte
AS
(
    SELECT *,COUNT(1) OVER(PARTITION BY cnt) pt  FROM
    (
        SELECT tt.*
           ,(SELECT COUNT(id) FROM t WHERE data <= 10 AND ID < tt.ID) AS cnt
        FROM  t tt
        WHERE data > 10
    ) t1
)

SELECT id, [when], data FROM cte WHERE pt >= 3

SQL FIDDLE DEMO

输出

id  when                    data
2   2013-08-02 00:00:00.000 121
3   2013-08-03 00:00:00.000 132
4   2013-08-04 00:00:00.000 15
6   2013-08-06 00:00:00.000 1435
7   2013-08-07 00:00:00.000 143
8   2013-08-08 00:00:00.000 18
9   2013-08-09 00:00:00.000 19

编辑

首先内部查询计算数据

SELECT tt.*
     ,(SELECT COUNT(id) FROM t WHERE data <= 10 AND ID < tt.ID) AS cnt
FROM  t tt

输出

id  when                    data   cnt
1   2013-08-01 00:00:00.000 1       1
2   2013-08-02 00:00:00.000 121     1
3   2013-08-03 00:00:00.000 132     1
4   2013-08-04 00:00:00.000 15      1
5   2013-08-05 00:00:00.000 9       2
6   2013-08-06 00:00:00.000 1435    2
7   2013-08-07 00:00:00.000 143     2
8   2013-08-08 00:00:00.000 18      2
9   2013-08-09 00:00:00.000 19      2
10  2013-08-10 00:00:00.000 1       3
11  2013-08-11 00:00:00.000 1234    3
12  2013-08-12 00:00:00.000 124     3
13  2013-08-13 00:00:00.000 6       4

然后我们过滤数据> 10的记录

WHERE data > 10

现在我们通过划分cnt列来统计记录

SELECT *,COUNT(1) OVER(PARTITION BY cnt) pt  FROM
(
    SELECT tt.*
        ,(SELECT COUNT(id) FROM t WHERE data <= 10 AND ID < tt.ID) AS cnt
    FROM  t tt
    WHERE data > 10
) t1

输出

id  when    data                   cnt  pt
2   2013-08-02 00:00:00.000 121     1   3
3   2013-08-03 00:00:00.000 132     1   3
4   2013-08-04 00:00:00.000 15      1   3
6   2013-08-06 00:00:00.000 1435    2   4
7   2013-08-07 00:00:00.000 143     2   4
8   2013-08-08 00:00:00.000 18      2   4
9   2013-08-09 00:00:00.000 19      2   4
11  2013-08-11 00:00:00.000 1234    3   2
12  2013-08-12 00:00:00.000 124     3   2

上面的查询和临时表一样放在cte中

现在选择连续计数 >= 3 的记录

SELECT id, [when], data FROM cte WHERE pt >= 3

另一种解决方案

;WITH partitioned AS (
  SELECT *, id - ROW_NUMBER() OVER (ORDER BY id) AS grp
  FROM t
  WHERE data > 10
),
counted AS (
  SELECT *, COUNT(*) OVER (PARTITION BY grp) AS cnt
  FROM partitioned
)

SELECT id, [when], data
FROM counted
WHERE cnt >= 3

Reference URL

SQL FIDDLE DEMO

【讨论】:

    【解决方案2】:

    首先,我们对任何值小于等于 10 的行进行折扣:

    WITH t10 AS (SELECT * FROM t WHERE data > 10),
    

    接下来,获取直接前导数也大于 10 的行:

    okleft AS (SELECT t10.*, pred.id AS predid FROM
       t10
       INNER JOIN t pred ON 
            pred.[when] < t10.[when]
            AND pred.[when] >= ALL (SELECT [when] FROM t t2 WHERE t2.[when] < t10.[when])
       WHERE pred.data > 10
    ),
    

    同时获取直接后继数也大于 10 的行:

    okright as (SELECT t10.*, succ.id AS succid FROM
       t10
       INNER JOIN t succ ON
            succ.[when] > t10.[when] 
            AND succ.[when] <= ALL (SELECT [when] FROM t t2 WHERE t2.[when] > t10.[when])
       WHERE succ.data > 10
    ),
    

    最后,选择任何以 3 开头、在 1 中间或以 1 结尾的行:

    有效右侧也有有效右侧的行开始一个至少为 3 的序列:

    starts3 AS (SELECT id, [when], data FROM okright r1 WHERE EXISTS(
    SELECT NULL FROM okright r2 WHERE r2.id = r1.succid)),
    

    前任和后继都有效的行在至少3个中间:

    mid3 AS (SELECT id, [when], data FROM okleft l WHERE EXISTS(
    SELECT NULL FROM okright r WHERE r.id = l.id)),
    

    有效左侧也有有效左侧的行结束至少 3 个序列:

    ends3 AS (SELECT id, [when], data FROM okleft l1 WHERE EXISTS(
    SELECT NULL FROM okleft l2 WHERE l2.id = l1.predid))
    

    将它们全部加入,使用 UNION 删除重复项:

    SELECT * FROM starts3
    UNION SELECT * FROM mid3
    UNION SELECT * FROM ends3
    

    SQL 提琴手:http://sqlfiddle.com/#!3/12f3a/9

    编辑:我喜欢 BVR 的回答,比我的要优雅得多。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-12-20
      • 1970-01-01
      • 2020-10-15
      • 1970-01-01
      • 2021-11-08
      相关资源
      最近更新 更多