【发布时间】:2017-07-13 18:33:33
【问题描述】:
下面是我试图处理的高级用例。
我们将学生数据流发布到 Kafka 主题中,我们的模块必须将学生 ID 作为流读取,并从多个来源为每个学生获取相关数据,并为每个学生执行一些计算,并为每个学生发布相关计算进入一个kafka主题。
所以这里的问题是最好编写一个大型 Spark 作业或使用 Akka 为每个源提供单独的服务,以便参与者可以并行工作,获取一堆学生 ID 并从各自的源获取数据并执行一些转换和动作,最后是与每个学生相关的计算。
或者我真的需要在这里使用 Akka 吗? Spark 会在内部有效地处理这个问题吗?
在这里欣赏任何想法。
【问题讨论】:
-
“是不是更好” 使它脱离了 StackOverflow 的主题。请改写您的问题。
标签: apache-spark akka akka-stream