【问题标题】:Spark Storm or Flink - Big Data analysisSpark Storm 或 Flink - 大数据分析
【发布时间】:2017-01-02 12:03:51
【问题描述】:

如果我在 Cassandra 表(3 节点集群)中有一个大型数据集并且我需要对每天收到的记录执行求和运算,谁能推荐我可以探索哪种技术。这样计算的计数需要在 MySQL 表中更新。

 Steps to perform - 
 1. Fetch Ids from MY SQL table
 2. Run Sum operation from Cassandra table
 3. Insert/update the calculated sum value in MYSQL table

目前我正在使用纯 Java 使用 SQL 和 CQL 查询来执行这些任务,但它非常缓慢,并且未来数据将呈指数增长。

任何人都可以提出可以探索的技术,以最快的方式和最短的开发时间完成这项任务。

【问题讨论】:

  • 要求我们推荐或查找书籍、工具、软件库、教程或其他场外资源的问题对于 Stack Overflow 来说是无关紧要的,因为它们往往会吸引固执己见的答案和垃圾邮件。相反,describe the problem 以及迄今为止为解决它所做的工作。

标签: apache-spark cassandra apache-storm apache-flink bigdata


【解决方案1】:

没有太多可推荐的,只取决于你的任务和你自己的喜好。

Apache Storm 是一个流引擎,如果您想处理条目流,而不是像您的情况那样处理一批数据,那就太好了。

Apache Spark 和 Apache Flink 都允许您每天执行一次批处理作业,或者制作一个流式应用程序来计算一天的结果。

我更喜欢 Apache Spark,因为它具有用于批处理和流式作业的统一 API(因此您可以轻松地将代码从批处理更改为流式)以及强大的社区支持。 Apache Flink 支持实时流,但在您的情况下不是必需的。

但是,您应该自己查看这两个框架并选择这个框架,它看起来更适合您。在我看来他们两个都会好的

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-12-15
    • 2018-09-28
    • 1970-01-01
    • 2020-05-03
    • 1970-01-01
    • 2017-02-02
    • 2020-10-13
    • 1970-01-01
    相关资源
    最近更新 更多