【发布时间】:2021-04-25 01:05:27
【问题描述】:
我正在构建一个Pipeline 对象来使用StringIndexer 对象对我的类别列进行编码。
indexers = [StringIndexer(inputCol='FirstName',
outputCol='FirstName_new',
handleInvalid='keep',
stringOrderType='frequencyDesc').fit(df)]
pipeline = Pipeline(stages=indexers)
pipeline.write().overwrite().save(path)
我想在另一列上使用相同的管道对象(我有一个需要它的特定用例)。有什么办法可以更改input_col 参数?
【问题讨论】:
标签: apache-spark pyspark apache-spark-mllib apache-spark-ml