【发布时间】:2016-05-14 17:41:56
【问题描述】:
我是 Mahout-Samsara 的新手,我正在尝试了解不同项目的“领域”以及它们之间的关系。 我知道 Apache Mahout-Samsara 弃用了许多 MapReduce 算法,并且事情将基于 Apache Flink 或 Spark 或其他引擎,如 h2o(基于“Apache Mahout:超越 MapReduce”一书的介绍)。
我想尝试一些推荐算法,但我不太确定什么是新的,什么是“弃用”。我看到以下链接,
参考spark-rowsimilarity 和spark-itemsimilarity。 (我不明白这些链接是在谈论自我算法还是设计......这可能是一种设计,因为它们没有在 mahout dot apachedot org/users/basics/algorithms.html 中列出......无论如何...)。
同时,Apache Flink(或者是 Spark MLLib?)实现了推荐的 ALS 算法(Machine Learning for Flink 和 Spark MLlib)。
一般问题:
是不是这些来自 mahout.apache.org 的算法被弃用了,它们正在被迁移到 Flink/Spark MLLib,所以 Flink/Spark MLLib 的 ML 库和支持会增长?
Flink / Spark MLLib 是否打算成为一个引擎或引擎+算法库,对算法有很好的支持?
有助于对话的其他链接:
具体问题:
我想尝试将推荐算法作为“灰盒”(部分是“黑盒”,因为我不想深入研究数学,部分“白盒”,因为我想调整模型和数学到我需要改进结果的程度)。
我对其他 ML 算法还不感兴趣。我考虑从现成的东西开始,然后更改 MLLib 的 ALS 实现。那会是一个好方法吗?还有其他建议吗?
【问题讨论】:
标签: apache-spark apache-flink mahout-recommender