【问题标题】:Django ORM - How to perform complex GROUP BY with values().annotate().values()Django ORM - 如何使用 values().annotate().values() 执行复杂的 GROUP BY
【发布时间】:2018-06-13 15:40:51
【问题描述】:

我正在尝试尽可能多地转换原始 SQL 以使用 Django ORM,但我遇到了障碍。我正在尝试执行与此类似的查询:

SELECT table.x,
      MAX(table.y) AS y,
      table.group_category,
      table.group_number,
FROM table
GROUP BY table.group_category, table.group_number

到目前为止,我一直在尝试对此进行一些排列:

q = MyModel.objects\
    .filter(**filter_kwargs)\
    .values('group_category', 'group_number')\
    .annotate(y=Max('y'))\
    .values('x','y','group_category','group_number')

但是,这似乎不起作用。如果我排除最后一个values(),它会产生以下(大致):

SELECT MAX(table.y) AS y,
      table.group_category,
      table.group_number,
FROM table
GROUP BY table.group_category, table.group_number

它没有选择table.x。但如果我包括最后一个values()...

SELECT table.x,
      MAX(table.y) AS y,
      table.group_category,
      table.group_number,
FROM table
GROUP BY x, y, table.group_category, table.group_number

它按x, y 分组。因此,显然正在发生的事情是所有值都被替换并注释使用 QuerySet 给出的任何值(因为它是懒惰地评估的?)。 docs on aggregation and values 似乎表明按此顺序执行两个值函数会产生预期的效果,我发现 a writeup(从 2013 年开始)也表明了这一点。难道我做错了什么?在 Django ORM 中这仍然可能吗?我有什么方法可以在不使用extra() 或原始 SQL 的情况下做到这一点?出于演示目的,我试图使此示例尽可能简单,但我的实际问题涉及 JOIN。这会让事情复杂化吗?


更新 1

我能够有点弄明白,但是,它仍然没有产生我想要的最佳版本(以上)的 SQL 查询。为了获得我需要的结果,我改为执行查询以获取 MAX(table.y),然后将其用作子查询,使用 __in 针对子查询的值。子查询进行分组。

filtered = MyModel.objects.filter(**filter_kwargs)

subq = filtered\
    .values('group_category', 'group_number')\
    .annotate(y=Max('y'))\
    .values_list('y', flat=True)

q = filtered\
    .filter(y__in=subq)\
    .values('x','y','group_category','group_number')

正如我所说,工作 为我提供了我需要的结果。问题是它慢得多 比只使用与 GROUP BY 不同的 SELECT,因为它创建了一个相对庞大的子查询。我还没有将其标记为答案,因为它仍然不会产生与我真正想要的匹配的查询。相反,它看起来像这样:

SELECT table.x,
      table.y,
      table.group_category,
      table.group_number,
FROM table
WHERE y IN 
    (SELECT MAX(U0.y) AS y
    FROM table U0
    GROUP BY U0.group_category, U0.group_number)

此外,看起来我什至不能使用extra(),因为它同样只会将列添加到已经是 QuerySet 一部分的 SELECT 子句,即values()


更新 2

事实证明,我凌乱的解决方法不起作用,因为它获取所有 y(1 行)的 MAX 并返回它,而不是按 group_category 和 group_number 将它们分组在一起,并使用 MAX 的 @987654342 @'s,所以我回到了绘图板上。

【问题讨论】:

标签: python mysql django orm django-queryset


【解决方案1】:

您似乎想要的是计算最大值,但返回所有行而不进行任何分组。这就是 Window 函数的用途(可从 Django 2.0 获得):

models = MyModel.objects.annotate(max=Window(
    expression=Max('y'),
    partition_by=[F('group_category'), F('group_number')],))

但是为什么您使用GROUP BY 的方法不起作用?

在原始查询中,Django(以及数据库;您引用的 SQL 会引发语法错误)坚持按 x 分组的原因是,如果您按 categorynumber 分组,您可能有一组categorynumber 的一组行的多个x 值。 DB应该选择哪一个?它不能为你做出这样的选择。

如果x 不重要,您可以忽略它。如果它很重要但对于一组categorynumber 始终具有相同的值,那么将查询按x 分组不会对您造成伤害。如果有不同的x并且它们很重要,您需要决定选择哪一个(并相应地告诉数据库)。 y 也是如此。

【讨论】:

    猜你喜欢
    • 2016-04-17
    • 2011-06-25
    • 2015-10-17
    • 2014-07-14
    • 1970-01-01
    • 2012-10-04
    • 2017-10-10
    • 2020-06-19
    相关资源
    最近更新 更多