【发布时间】:2013-06-11 20:36:51
【问题描述】:
我目前的聚合是:
db.group_members.aggregate({
$match: { user_id: { $in: [1,2,3] } }
}, {
$group: { _id: "$group_id" }
}, {
$sort: { last_post_at: -1 }
}, {
$limit: 5
})
对于文档结构:
{
_id: '...',
user_id: '...',
group_id: '...',
last_post_at: Date,
}
我在{user_id: 1, last_post_at: -1}上也有一个索引
既然我的索引已经在last_post_at 上,那么排序没用吗?我不是 100% 确定这个顺序。
我的最终目标是复制这个 SQL:
SELECT DISTINCT ON (group_id)
FROM group_members
WHERE user_id in [1,2,3]
ORDER_BY last_post_at DESC
LIMIT 5
我想知道如何使它对一个非常大的 group_members 具有高性能并且仍然以正确的顺序返回它。
更新: 我希望找到一种解决方案来限制加载到内存中的文档数量。这将是一个相当大的集合并且非常频繁地访问。
【问题讨论】:
-
您在 $group 阶段缺少分组操作 - 您想要 last_post:{$max:"$last_post_at"} 或类似的东西。
-
那是否还需要将 user_id: { $in: [1,2,3] } 的整个子集存储在内存中?
-
该组必须遍历所有匹配的文档 - 因为您的排序和限制基于 aggregated 值,因此不能在组之前进行限制。可以想象,可以对组之前的每个 user_id 值进行排序和限制的优化,但目前在 2.4 MongoDB 中尚未实现。
标签: mongodb aggregation-framework