【问题标题】:Difference in usecases for AWS Sagemaker vs Databricks?AWS Sagemaker 与 Databricks 的用例有何不同?
【发布时间】:2019-08-03 13:57:43
【问题描述】:

我之所以关注 Databricks,是因为它与 Kinesis 等 AWS 服务集成,但在我看来,SageMaker 是 Databricks 的直接竞争对手?我们大量使用 AWS,是否有任何理由将 DataBricks 添加到堆栈中或 odes SageMaker 填补相同的角色?

【问题讨论】:

    标签: apache-spark pyspark databricks amazon-sagemaker


    【解决方案1】:

    去年我曾在这两种环境中工作过,我特别记得:

    • Databricks 可以轻松访问存储的数据库/表,以在 Jupyter Notebooks 中查询和使用 Scala/Spark。我记得能够快速查看和预览模式和查询并参加比赛进行研究是多么美好。我还记得在笔记本上设置定时作业(每月重新运行)并通过单击一些按钮重新扩展到作业实例类型(便宜得多)的快速功能。这些功能可能存在于 AWS 中的某个地方,但我记得它在 Databricks 中很棒。

    • AWS SageMaker + Lambda + API Gateway:说真的,今天我完成了 AWS SageMaker + Lambda + API Gateway 的部署,并在习惯了 Lambda + API 的一些语法和细节之后网关非常简单。进行另一次 AWS 部署不会超过 20 分钟(待定独特性)。模型监控和 CloudWatch 等其他东西也不错。我确实注意到了许多语言的 Jupyter Notebook 内核,比如 Python(我用它做的)、R 和 Scala,以及已经预装的特定包,比如 conda 和 sagemaker ml 包和方法。

    【讨论】:

      【解决方案2】:

      SageMaker 是一款出色的部署工具,它简化了很多配置容器的流程,您只需编写 2-3 行代码即可将模型部署为端点并使用它。 SageMaker 还提供了支持 Python 和 Scala(sparkmagic 内核)开发的开发平台(Jupyter Notebook),我在 jupyter notebook 中安装了外部 scala 内核。总体而言,SageMaker 提供端到端的 ML 服务。 Databricks 为 Spark 开发提供了无与伦比的 Notebook 环境。

      结论

      1. Databricks 是更好的大数据(scala、pyspark)开发平台。(无与伦比的笔记本环境)

      2. SageMaker 更适合部署。如果你不是在处理大数据,SageMaker 是一个完美的选择(Jupyter notebook + Sklearn + 成熟的容器 + 超级简单的部署)。

      3. SageMaker 提供“实时推理”,非常易于构建和部署,令人印象深刻。你可以查看官方的 SageMaker Github。 https://github.com/awslabs/amazon-sagemaker-examples/tree/master/sagemaker-python-sdk/scikit_learn_inference_pipeline

      【讨论】:

      • 谢谢!它是一种东西还是一种东西,或者有什么理由你会在同一个管道中使用两者?
      • 如果您正在使用 Spark 进行大数据分析。我建议使用 Databricks + SageMaker。 (我认为 Databricks 对于非常大的分析项目来说更昂贵)。 Spark ML 管道 + SageMaker 端点部署和 cloudwatch 监控是完美的。但是,如果您正在处理小数据。不需要Databricks。带有 SageMaker 的 Jupyter 笔记本就足够了。
      猜你喜欢
      • 2020-05-02
      • 2022-12-24
      • 1970-01-01
      • 2021-12-05
      • 1970-01-01
      • 2021-08-21
      • 2021-01-18
      • 2020-07-05
      • 1970-01-01
      相关资源
      最近更新 更多