【问题标题】:how to track a finite data stream from start to finish?如何从头到尾跟踪有限的数据流?
【发布时间】:2019-06-17 02:43:13
【问题描述】:

我们正在构建一种网络爬取机制,并希望最终用户能够尽快查看收集到的结果,并在所有数据都在数据库中时收到通知。 收集结果通过最少的 ETL 处理。我们正在寻找一个 ETL,它会在处理整个有限流时发出通知(如果可能的话,还会通知一些进展)。流被拆分为一组 Zip 文件 + 一个包含 zip 文件列表的文件(当流被完全抓取时,它将异步到达 ETL)。

我们查看了 apache flink 和 apache nifi。 Apache flink 支持批处理,客户端可以等到批处理完成,但这里的数据更像是一个有限流,这意味着处理应该在所有数据可用之前开始,并基于另一个列出所有 zip 文件的文件结束。使用通知和等待的 Apache nifi 似乎更适合这项工作。它可以与 nifi 一起使用吗? nifi 是为这种情况设计的吗?可以 nify 通知有限流的进度和完成吗?如果有的话有什么缺点?还有其他选择吗?

【问题讨论】:

    标签: apache-flink apache-nifi


    【解决方案1】:

    你可以有一个有界的 Flink 流。我会创建一个自定义的SourceFunction,它使用“zip 文件列表”来决定何时终止。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-08-01
      • 1970-01-01
      • 2019-07-08
      • 2016-04-25
      • 1970-01-01
      • 2016-11-30
      • 1970-01-01
      相关资源
      最近更新 更多