【发布时间】:2015-07-25 02:14:58
【问题描述】:
我刚刚阅读了 DataStax 帖子“Basic Rules of Cassandra Data Modeling”,总而言之,我们应该通过查询而不是关系/对象来建模我们的数据库模式。因此,许多表可以有相同的重复数据,例如users_by_email 和users_by_username 都具有相同的数据。
如何处理对象更新?
例如,用户编辑他的电子邮件,我是手动 UPDATE 两个表还是只 INSERT 包含所有列的对象并且不关心以前的数据(它们仍在我的数据库中,但列值错误=>电子邮件)。
如果是UPDATE,我该如何处理数据同步?
目前,我正在手动操作,但有什么工具可以帮助我吗?因为,我可能有 5 或 6 个具有不同分区/集群键的表。
听说Hadoop可以,Apache Spark也可以。
【问题讨论】: