【问题标题】:Play Framework with Spark MLib vs PredictionIO使用 Spark MLlib 与 PredictionIO 玩框架
【发布时间】:2017-03-17 12:24:04
【问题描述】:

早上好,

目前,我正在探索为我工作的公司构建内部平台的选项。我们的团队负责公司的数据仓库和报告。

随着我们的发展,我们将开发一个内部网来满足公司的一些需求,并且一段时间以来,我正在考虑将 scala(和 PlayFramework)作为前进的方向。

这还将涉及大量机器学习来集群客户、预测销售演变等。这是我开始思考 Spark ML 并遇到 PredictionIO 的时候。

随着我们将技能转向数据科学,哪些方面对我们/公司最有益:

  • 在 Play 和 Spark 之上构建一切,并在同一个项目中同时使用平台和机器学习
  • 使用 Play 和 PredictionIO,其中大部分内容已经准备好

我不是试图基于意见提出问题,而是从您的经验/架构/解决方案中学习。

谢谢

【问题讨论】:

    标签: scala apache-spark machine-learning playframework-2.0 predictionio


    【解决方案1】:

    两者都是不错的选择:1. 如果您是 ML 的新手,请使用 PredictionIO,这很容易上手,但从长远来看会限制您,2. 如果您对自己的 @987654324 有信心,请使用 spark @ 和 data engineering team,spark 拥有优秀且易于使用的 api 以及广泛的 ML 库,表示为了将事物投入生产,您将需要一些分布式 spark 知识 - 经验,有时很难做到高效可靠。

    以下是选项:

    1. spark databricks cloud 昂贵但易于使用的 spark,无需数据工程
    2. PredictionIO 如果您确定他们的ML 可以解决您的所有业务案例
    3. sparkgoogle dataproc 中,易于管理的集群比 aws 少 60%,仍然需要一些工程

    总结:PredictionIO 用于快速修复,spark 用于长期数据 - 科学/工程开发。您可以从databricks 开始,以最大限度地减少专业知识开销,然后转到dataproc 以最大限度地降低成本

    【讨论】:

    • 你能解释一下“PredictionIO 会从长远来看限制你”这一行吗?
    • @Abhimanyu,尽管PredictionIO 现在是基于spark ML,但您将主要将其用于通过Deploy the Engine as Service model 模板构建模型。现在,构建模型只是ML pipeline 的一小部分,通常您需要为training data 创建灵活的ETL pipeline,以及streamingbatch 等部署环境。 Spark 通过其友好的语法连接data scienceengineering,让您可以在一个框架中处理整个流程。
    【解决方案2】:

    PredictionIO 的大部分引擎模板都使用 Spark 的 MLLib。

    我不知道你为什么要把两者分开?

    PredictionIO 与 Spark 一样灵活,并且可以选择使用其他库,例如 deeplearning4j 和 H2O 等等。

    【讨论】:

      猜你喜欢
      • 2015-12-18
      • 1970-01-01
      • 2015-01-12
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-03-07
      • 2016-12-13
      相关资源
      最近更新 更多