【问题标题】:Limit consuming data by Kafka in spark streaming限制Kafka在火花流中的消费数据
【发布时间】:2018-07-16 11:52:44
【问题描述】:

我正在从事火花流项目。 Spark 从 kafka 获取数据。我想通过火花流限制记录消耗。关于 kafka 的数据非常庞大。我使用spark.streaming.kafka.maxRatePerPartition=1 属性来限制spark 中的记录。但仍然在 5 分钟的批次中,我收到了 13400 条消息。我的 spark 程序每 5 分钟不能处理超过 1000 条消息。 Kafka 主题有 3 个分区。我的火花驱动程序内存为 5GB,有 3 个执行器,每个执行器 3GB。我如何在火花流中限制 kafka 的消息消耗。

【问题讨论】:

    标签: apache-kafka spark-streaming kafka-consumer-api


    【解决方案1】:

    你试过设置下面的道具吗?

    spark.streaming.backpressure.enabled
    spark.streaming.backpressure.initialRate
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-07-18
      • 2017-04-27
      • 1970-01-01
      • 2020-12-30
      • 2020-11-21
      • 2019-09-20
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多