【问题标题】:Create one collection for each user vs create one collection for all user为每个用户创建一个集合与为所有用户创建一个集合
【发布时间】:2013-09-12 08:58:49
【问题描述】:

我在 Ubuntu 环境下使用 PHP 和 MySQL 作为社交网络系统。

我有一个名为 user_feed 的 MySQL 表,在这个表中,我将每个用户的提要保存为 feed_id,我在 MySQL 中的表结构是:

    |user_feed_id | user_id | content_id | seen |

我有一个表user_follow,其中包含每个用户关注的数据,因此每个用户都有他/她关注的内容的记录集。

表结构:

follow_id | user_id  | content_id | 

在 user_feed 表中我有超过 1.7 亿条记录,每个用户都有一组记录,在user_follow 表中我有超过 500 000 条记录。

我目前正在从 MySQL 迁移到 MongoDB。所以我需要将此表转换为 MongoDB 中的集合。我想为user_feeduser_follow 建立我的收藏,如下所示:

为每个用户创建集合,该集合包含三个文档,一个用于关注 ID,另一个用于 feed_ids,因此当我处理用户配置文件时,我将为每个成员运行一个集合的查询:

每个集合名称都引用 user_id ,例如:

user_id_1 as collection name

            { user_id: '1'}
            {
                feed_ids: [
                 { content_id: '10', 'seen' : 1 },
                 { content_id: '11', 'seen' : 0 },
                 { content_id: '12', 'seen' : 1 },
                 { content_id: '13', 'seen' : 1 }
              ] 
            }
            {
             follow_ids: [
                 { content_id: '10' },
                 { content_id: '20'},
                 { content_id: '23'},
                 { content_id: '24'}
             ]
           }


user_id_2 as collection name

            { user_id: '2'}
            {
                feed_ids: [
                 { content_id: '14', 'seen' : 1 },
                 { content_id: '15', 'seen' : 0 },
                 { content_id: '16', 'seen' : 0 },
                 { content_id: '17', 'seen' : 0 }
              ] 
            }
            {
             follow_ids: [
                 { content_id: '22' },
                 { content_id: '23'},
                 { content_id: '24'},
                 { content_id: '25'}
             ]
           }

所以如果我有 70 000 个用户,那么我需要在 MongoDB 中创建 70 000 个集合

我还有另一个选择来创建它:

一个集合的所有用户供稿,每个用户在集合中都有一个文档,例如:

{
        user_id: '1',
        feed_ids: [
            { content_id: '10'},
            { content_id: '11'},
            { content_id: '12'}
        ],

        follow_ids: [
            { content_id: '9'},
            { content_id: '11'},
            { content_id: '14'}
        ]
    }

这些表中的数据增长非常显着,我需要集合和文档能够执行所有操作,例如 (插入、更新、选择、..)

我的 feed_ids 和 follow_ids 增长非常显着,我的查询是:

select content_id from user_feed where user_id =1 limit 10 offset 20;

update user_feed set seen = 1 where user_id =1

select count(content_id) from user_feed where seen = 0;

select content_id from user_follow where user_feed_id =1 limit 10 offset 20;

insert into user_feed (user_id,content_id,seen) values (1,23,0); 

第一个选项是我用例的最佳解决方案还是第二个?

谢谢。

【问题讨论】:

  • 我不会为每个用户创建一个集合。我将有一个目的的集合并为每个用户创建文档。此外,如果您知道您的架构并知道您希望在这些文档中放入什么,您可以使用预先分配的方法来避免“瑞士奶酪”并在不分散空间的情况下扩展您的文档。我建议你看看这本书:“MongoDB 应用设计模式”第 8 章是关于社交网络的。您可以找到非常好的架构示例以及一些您可能感兴趣的代码。还有一件事,避免复杂性,它只会破坏您的项目稳定性!

标签: php mongodb nosql


【解决方案1】:

由于nssize 限制 (2GB),每个用户的一个集合永远不会扩展,因为这意味着每个数据库限制为 300 万用户(假设数据库只包含用户......)。一旦你开始在多个数据库上跨过这样的事情,那么你就真的开始遇到实施问题了。

此设置没有性能优势,因为主要优势是锁定并且在数据库级别。我仍然认为我在上面段落中的第一点会保留锁,即使它是按集合实现的。作为补充说明,由于 MongoDB 在更新未绑定数组时处理单个文档的方式,您将无法有效利用空间,这将产生“瑞士奶酪”效应并导致大量碎片进一步降低性能。

因此,仅基于此,不,我不会为每个用户制作一个集合。

【讨论】:

  • @jetawe 另请注意,MongoDB 的优势是通过一个分片集群水平分片巨大的集合,使用这种优势而不是试图避免它
  • 所以根据您的回答,您认为第二个选项是我用例中最好的选择。
  • @jetawe 在考虑只使用一个集合的情况下是的;架构...那将是另一个问题,我们可能需要更多信息
  • 架构需要什么信息,请帮助我。
  • @jetawe Prolly 不知道 feeds 和 feeds_ids 的大小以及完成了哪些查询以及这些数组是什么......嗯,也许更多
猜你喜欢
  • 2017-07-25
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多