【发布时间】:2016-04-19 07:57:36
【问题描述】:
很明显,火花流中的开箱即用连接功能并不能保证很多现实生活中的用例。原因是它只加入了微批处理 RDD 中包含的数据。
用例是将来自两个 kafka 流的数据连接起来,并将 stream1 中的每个对象用它在 spark 中的 stream2 中的相应对象丰富,并将其保存到 HBase。
实施将
在内存中维护来自 stream2 对象的数据集,在收到对象时添加或替换对象
对于stream1中的每个元素,访问缓存以从stream2中找到匹配的对象,如果找到匹配则保存到HBase,否则将其放回kafka流中。
这个问题是关于 Spark 流的探索,它的 API 是为了找到实现上述方法的方法。
【问题讨论】:
-
问题是……?
-
把查询放在最后一行,看看现在对你有没有意义。
标签: join apache-spark apache-kafka spark-streaming