【发布时间】:2018-12-14 00:32:20
【问题描述】:
我了解 Spark/Hadoop 的大数据功能,但我被要求将它们用于一组似乎并不真正适合其中的流程,我需要进行健全性检查。
这些流程在较高级别上是并行的,但包含固有的顺序独立子流程,无法并行化。这方面的一个例子是启动的 X 个并行顶级进程。每个都使用不同的配置来运行一组有些独立的子流程:
- 下载一组 XML(顺序)
- 验证每个 XML(按顺序)
- 轻松处理每个 XML(按顺序)
- 加载到数据存储中(按顺序)
处理包含一些转换,但在大数据方面并不多。该处理是可能受益的一个步骤,但它仍然必须针对一个流程按顺序完成。
对我来说,这似乎不是大数据。事实上,这似乎是对该平台的完全误用。在这种情况下,唯一的好处可能是为了支持目的而整合多个平台,但总的来说,spark/hadoop 生态系统不会为这种业务流程提供任何好处,对吧?
还是我疯了?
【问题讨论】:
-
我个人会为此尝试 Apache NiFi 而不是编写 Spark 代码
-
是的,我看过 NiFi,并且仍在调查它。我正在寻找的真正东西是强大的 API 和 SDK。我们不能出售其他工具的 UI,因为它不会是客户的需求。所以充其量我们会构建自己的 UI 并使用底层平台作为引擎。因此,任何强调其自身 UI 的工具都无法运行。我还没有确定 Nifi 是否符合要求。
-
NiFi 有一个 REST API 来创建处理器和组 - nifi.apache.org/docs/nifi-docs/rest-api/index.html
标签: apache-spark hadoop bigdata