【发布时间】:2015-08-11 22:32:13
【问题描述】:
我想了解如何做以下事情:
我想用 spark 维护一个二叉搜索树 (BST)。
我有 2 个简单的操作,我在流媒体中得到它们。
这就是我考虑使用 Spark Streaming 的原因。
操作如下:
a) 向 BST 添加一个数字
b) 删除一个号码
*假设我没有重复的数字。
我怎样才能以正确的方式做到这一点?我的主要问题是我不确定我应该把树放在哪里。
(假设它的大小总是适合我的 RAM)
对我来说,这里的“大数据”是操作的数量,所以我想使用 Spark Streaming 来处理大量来自流的操作。
同样,树保持小,并且总是适合 RAM。 (如果没有呢?)
最好的方法是什么?
除此之外,我想使用 Stack 数据结构而不是 BST 来做同样的事情。
操作只是push和pop数字。
也许 Apache Storm 更适合这些任务?
【问题讨论】:
标签: apache-spark spark-streaming apache-storm