【问题标题】:How to GROUP BY consecutive data (date in this case)如何 GROUP BY 连续数据(在这种情况下为日期)
【发布时间】:2013-04-26 06:25:30
【问题描述】:

我有一个products 表和一个sales 表,用于记录特定产品在每个日期内售出的商品数量。当然,并非所有产品每天都有销售。

我需要生成一份报告,告诉我产品已连续天销售(从最近日期到过去)以及仅在这些天销售了多少商品。 p>

我想告诉你到目前为止我已经尝试了多少事情,但唯一成功的(并且缓慢的、递归的)是我的应用程序内部的解决方案,而不是我想要的 SQL 内部的解决方案。

我也浏览了几个关于 SO 的类似问题,但我没有找到一个可以让我清楚地了解我真正需要什么的问题。

我设置了一个SQLFiddle here 来告诉你我在说什么。在那里你会看到我能想到的唯一查询,它没有给我我需要的结果。我还在那里添加了 cmets,显示查询的结果应该是什么。

我希望这里有人知道如何做到这一点。提前感谢任何 cmets!

弗朗西斯科

【问题讨论】:

  • 我认为您需要递归连接来实现 MySQL 无法实现的功能。你能在数据库上创建存储过程吗?
  • 是的,服务器是我的。

标签: mysql sql group-by


【解决方案1】:

http://sqlfiddle.com/#!2/20108/1

这是一个完成这项工作的存储过程

CREATE PROCEDURE myProc()
BEGIN
    -- Drop and create the temp table
    DROP TABLE IF EXISTS reached;
    CREATE TABLE reached (
    sku CHAR(32) PRIMARY KEY,
    record_date date,
    nb int,
    total int)
   ENGINE=HEAP;

-- Initial insert, the starting point is the MAX sales record_date of each product
INSERT INTO reached 
SELECT products.sku, max(sales.record_date), 0, 0
FROM products
join sales on sales.sku = products.sku
group by products.sku;

-- loop until there is no more updated rows
iterloop: LOOP
    -- Update the temptable with the values of the date - 1 row if found
    update reached
    join sales on sales.sku=reached.sku and sales.record_date=reached.record_date
    set reached.record_date = reached.record_date - INTERVAL 1 day, 
        reached.nb=reached.nb+1, 
        reached.total=reached.total + sales.items;

    -- If no more rows are updated it means we hit the most longest days_sold
    IF ROW_COUNT() = 0 THEN
        LEAVE iterloop;
    END IF;
END LOOP iterloop;

-- select the results of the temp table
SELECT products.sku, products.title, products.price, reached.total as sales, reached.nb as days_sold 
from reached
join products on products.sku=reached.sku;

END//

那你只需要做

call myProc()

【讨论】:

  • 哇,谢谢。我从没想过它会花费那么多,但它肯定比在应用程序级别处理它更快更好。非常感谢您花时间写这个答案。 :-)
  • 可能有更快/更清洁的方法,但两周前我遇到了几乎相同的问题,并为此编写了一个程序。很容易根据您的问题调整它
【解决方案2】:

没有存储过程的纯 SQL 解决方案:Fiddle

SELECT sku
     , COUNT(1) AS consecutive_days
     , SUM(items) AS items
FROM
(
  SELECT sku
       , items
       -- generate a new guid for each group of consecutive date
       -- ie : starting with day_before is null
       , @guid := IF(@sku = sku and day_before IS NULL, UUID(), @guid) AS uuid
       , @sku := sku AS dummy_sku
  FROM 
  (
    SELECT currents.sku
         , befores.record_date as day_before
         , currents.items
    FROM sales currents
      LEFT JOIN sales befores 
        ON currents.sku = befores.sku 
        AND currents.record_date = befores.record_date + INTERVAL 1 DAY
    ORDER BY currents.sku, currents.record_date
  )  AS main_join
    CROSS JOIN (SELECT @sku:=0) foo_sku
    CROSS JOIN (SELECT @guid:=UUID()) foo_guid
) AS result_to_group
GROUP BY uuid, sku

查询真的没那么难。通过cross join (SELECT @type:=0) type 声明变量。然后在选择中,您可以逐行设置变量值。是模拟Rank函数所必需的。

【讨论】:

  • 哇。我必须进行一些研究才能理解您的查询。这将是我第一次使用items, @guid := IF(...cross join 之类的东西。谢谢,这似乎是一个非常好的方法。 :-)
  • @FranciscoZarabozo :这并不难。测试每个子查询并观察结果,然后您就可以轻松理解发生了什么。
  • 我真的很喜欢这种方法,如果销售表随着时间增长很多,那么性能与存储过程呢?你的陈述得到了所有连续日期的块,这很好,但在一张大桌子上可能是个问题。无论如何,非常感谢您的查询,我学到了很多分析它
【解决方案3】:
select
  p.*,
  sum(s.items) sales,
  count(s.record_date) days_sold
from
  products p
join
  sales s
  on
  s.sku = p.sku
where record_date between '2013-04-18 00:00:00' and '2013-04-26 00:00:00'
group by sku; 

【讨论】:

  • 谢谢,但是......这不只计算连续日期的记录,也不计算过去的记录,因为它们只是连续的。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2021-08-31
  • 2012-10-12
  • 1970-01-01
  • 1970-01-01
  • 2017-03-17
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多