【发布时间】:2023-04-04 13:40:01
【问题描述】:
我想建立一个系统,每小时收集社交网络数据,并对特定分享/帖子(可能有数千个)上发生的情况进行采样。 完成爬取后,我想将其保存在一个大数据数据库中,以便稍后进行分析。
分析过程可能是 Spark 甚至是应用程序代码分析。 这意味着我正在寻找可以让我: 1.查询。 2. Spark等常用的数据处理都可以在上面使用。
你会推荐哪一个? HBase? MongoDB?沙发床?大表? DynamoDB?
谢谢!
【问题讨论】:
-
您似乎想以“批量”方式将每小时的社交网络数据存储到这个 nosql 数据库中,并使用该数据库来驱动主要分析。如果那是用例,那么我肯定会看看 Apache Phoenix/HBase。在 HBase 中,您可以非常高效地批量导入数据。在 HBase 之上使用 Phoenix,您可以获得类似 SQL 的界面。您是否还会使用此数据库进行随机读取(单行读取而不是顺序读取)? Cassandra 是另一个值得关注的选项。 Cassandra 和 Couchbase 在功能上相似。其他因素包括云/本地。