【发布时间】:2017-12-30 08:18:21
【问题描述】:
我想使用 naive 分类器模型预测 Spark dataframe 的输出类。我使用 Spark 2.1.0 的结构化流功能。
当我尝试这样做时:
tokenizer = Tokenizer(inputCol="message", outputCol="logTokenize")
tokenizeData = tokenizer.transform(stream_df)
hashingTF = HashingTF(inputCol="logTokenize", outputCol="rawFeatures", numFeatures = 1000)
featurizedData = hashingTF.transform(tokenizeData)
stream_df = featurizedData.select("rawFeatures")
path = "/tmp/NaiveClassifier"
naive_classifier_model = NaiveBayesModel.load(spark.sparkContext, path)
predictions = naive_classifier_model.predict(stream_df)
我收到以下错误消息:
TypeError: 无法将类型
转换为 Vector
stream_df 是一个 Spark 数据框,我想获得一个包含 rawFeatures 和预测类列的数据框。
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql spark-streaming