【问题标题】:fit in distributed, predict in a stand alone适合分布式,独立预测
【发布时间】:2016-12-26 17:28:54
【问题描述】:

如何在分布式大数据平台(例如 Apache Spark)中训练(拟合)模型,同时在独立机器(例如 JVM)中使用该模型并尽可能少地依赖?

我听说过PMML,但我不确定它是否足够。 Spark 2.0 supports persistent model也在保存,但我不确定加载和运行这些模型需要什么。

【问题讨论】:

    标签: apache-spark jvm pmml


    【解决方案1】:

    Apache Spark 持久性是关于以 JSON 数据格式保存和加载 Spark ML 管道(将其视为 Python 的 pickle 机制或 R 的 RDS 机制)。这些 JSON 数据结构映射到 Spark ML 类。它们在其他平台上没有意义。

    对于 PMML,您可以使用 JPMML-SparkML 库将 Spark ML 管道转换为 PMML 文档。您可以使用 JPMML-Evaluator 库执行 PMML 文档(无论它们来自 Apache Spark、Python 还是 R)。如果您使用Apache Maven 来管理和构建您的项目,则只需向项目的 POM 添加一个依赖项声明即可包含 JPMML-Evaluator。

    【讨论】:

      猜你喜欢
      • 2013-10-21
      • 1970-01-01
      • 2018-12-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-02-26
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多