【问题标题】:spark 1.3.1: Dataframe breaking MLib APIspark 1.3.1:破坏 MLib API 的数据框
【发布时间】:2015-06-28 03:42:50
【问题描述】:

我正在尝试结合使用 Spark SQL 和 MLib 在 python 中创建一个推荐程序(扩展电影推荐程序)。它在 1.2.0 上运行良好。 但是,在 1.3.1 中,默认情况下 spark 创建 Dataframe 对象而不是 SchemaRDD 对象作为 SQL 的输出。因此,mlib.ALS.train 方法因断言错误而失败: 断言(评级,RDD) (当然评级不再是 RDD 了 :))

有人遇到这个问题吗?任何解决方法(我想使用地图只是将 DF 转换为 RDD,但那很愚蠢:))

【问题讨论】:

  • 你能显示一些代码吗?我已经在 spark 1.3.1 中尝试过建议,但没有看到这个问题。

标签: python apache-spark apache-spark-sql


【解决方案1】:

我认为社区会对此进行修补。但是现在,我们可以在 ALS.train 中使用 Dataframe.rdd(或者我们看到只允许使用 RDD 的任何其他地方)

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2022-01-01
    • 2017-04-30
    • 2021-03-14
    • 2015-06-05
    • 1970-01-01
    • 2016-12-07
    • 2015-12-27
    • 2013-03-10
    相关资源
    最近更新 更多