【发布时间】:2017-04-25 14:50:28
【问题描述】:
对于使用 kafka 的 Spark 流,我们有 Directstream,它是无接收器的方法,并将 kafka 分区映射到 spark RDD 分区。目前我们有一个应用程序,我们在其中使用 Kafka Direct 方法并在 RDBMS 中维护我们的偏移量,
我们有类似的 Kinesis 吗?当我阅读 spark-Kinesis 集成的文档时,感觉检查点存在差异。以下是我的一些问题
- 使用 kinesis 流式处理是否将 kinesis 分片映射到 RDD 分区?如果我在传入的 RDD 上使用 forEachPartition,我可以在分片级别保持有序处理吗?
- 从文档中解释了 kinesis 在 dynamoDB 中维护单独的检查点?我们不能忽略它并使用我们自己的偏移管理吗?
- 在 KinesisUtils.createStream api 中,我看到对于 [初始位置] 变量,它只需要 LATEST 或 TRIM_HORIZON。在那种情况下,我怎么能不能像我在 kafka 案例中提供的那样提供要偏移的分片映射?
如果我们的应用程序是幂等的,我们如何才能得到恰好一次处理?
【问题讨论】:
标签: apache-spark spark-streaming amazon-kinesis