【发布时间】:2017-08-24 02:05:36
【问题描述】:
我创建了一个包含多个转换器的 ML 管道,其中包括一个在数据标签训练期间使用的 StringIndexer。 然后我存储生成的 PipelineModel,稍后将用于在没有标签的数据集上进行数据准备和预测。
问题是创建的管道模型的 transform 函数无法应用于新的 DataFrame,因为它期望数据标签可用。
我错过了什么? 这应该怎么做?
注意:我的目标是拥有一个单一的管道(即我想将各种转换和 ML 算法保持在一起)
谢谢!
【问题讨论】:
标签: apache-spark apache-spark-sql spark-dataframe apache-spark-mllib