【发布时间】:2019-02-12 11:42:43
【问题描述】:
我有一个结构化的行作为输入,写入速率为每秒 10K。每行有 20 列。应该对这些输入回答一些查询。因为大部分查询需要不同的WHERE、GROUP BY或ORDER BY,最终的数据模型是这样的:
primary key for table of query1 : ((column1,column2),column3,column4)
primary key for table of query2 : ((column3,column4),column2,column1)
and so on
我知道 Cassandra 数据模型中的表数量有限制(200 表示警告,500 表示失败)
因为对于每个输入行我都应该在每个表中进行插入,所以每秒的最终写入变成了大*大数据!:
writes per seconds = 10K (input)
* number of tables (queries)
* replication factor
主要问题:我是否走在正确的道路上?即使输入率已经很高,每个查询都有一个表是否正常?
我不应该使用 spark 或 hadoop 之类的东西而不是依赖裸数据模型吗?还是事件 Hbase 而不是 Cassandra?
【问题讨论】:
-
您使用的是普通 Cassandra 还是 DSE?
-
普通卡桑德拉