【问题标题】:Spark ML pipeline usageSpark ML 管道使用
【发布时间】:2017-08-24 02:05:36
【问题描述】:

我创建了一个包含多个转换器的 ML 管道,其中包括一个在数据标签训练期间使用的 StringIndexer。 然后我存储生成的 PipelineModel,稍后将用于在没有标签的数据集上进行数据准备和预测。

问题是创建的管道模型的 transform 函数无法应用于新的 DataFrame,因为它期望数据标签可用。

我错过了什么? 这应该怎么做?

注意:我的目标是拥有一个单一的管道(即我想将各种转换和 ML 算法保持在一起)

谢谢!

【问题讨论】:

    标签: apache-spark apache-spark-sql spark-dataframe apache-spark-mllib


    【解决方案1】:

    您应该粘贴您的源代码。然后您的测试数据格式应该与您的火车数据一致,包括特征名称。但您不需要标签列。 可以参考official site

    【讨论】:

      猜你喜欢
      • 2016-05-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-02-11
      • 2016-09-29
      • 1970-01-01
      • 1970-01-01
      • 2018-12-31
      相关资源
      最近更新 更多