【问题标题】:Talend and Apache Spark?Talend 和 Apache Spark?
【发布时间】:2016-11-02 01:49:00
【问题描述】:

我对 Talend 和 Apache Spark 在大数据生态系统中的位置感到困惑,因为 Apache Spark 和 Talend 都可以用于 ETL。

有人可以举个例子解释一下吗?

【问题讨论】:

标签: hadoop apache-spark etl talend data-integration


【解决方案1】:

Talend 是一种基于工具的大数据方法,支持所有带有内置组件的大数据应用程序。 spark是基于代码的方法,您需要为用例编写代码。

【讨论】:

    【解决方案2】:

    事实上,Talend Big Data Studio 会为设计的 ETL 作业生成 Apache Spark 代码。所以本质上它们是相同的。

    【讨论】:

    • 所以本质上它们是相同的......不可能是真的。一个人用 scala、java、pyspark 自己编写 spark 代码。另一个生成代码,它们在功能上可能等同于同一事物,但它们不是同一事物。希望这会有所帮助
    • 这个问题是在考虑 ETL 的情况下提出的,因此在这种情况下它们本质上是相同的,而不是编写自己的 Spark 代码来生成它。 Apache Spark 作为一个整体是另一头野兽。上下文在这里很重要,例如其他 ETL 供应商需要中间件才能在 Spark 集群上运行,因此它们不是纯 Spark。
    • 所以你同意我的看法
    【解决方案3】:

    Talend Studio 提供内置组件,Spark 是这背后的主要引擎。由于内置组件,它减少了编码时间。但是,如果您将直接使用 Spark 和 Scala java 或 python 进行编码,则需要时间来构建通用组件。 Talend 让生活更轻松,并且很容易被传统的 etl 开发人员采用。例如,如果某人来自 abi initio,他们可以通过查看 Talend 提供的图表或血统来进行关联。但是为了扩展业务组件,人们需要在 Talend 工作室中用 Spark 编写代码 I.Java。 Talend 负责打包 jar 并将其从 Windows 部署到服务器并运行并在其控制台中显示结果的另一件事。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-09-15
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-08-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多