【问题标题】:Pyspark: Using dataframe in ml algorithmsPyspark:在机器学习算法中使用数据框
【发布时间】:2016-11-28 07:11:55
【问题描述】:

我了解,为了将 ml.clustering Kmeans 算法(实际上是任何 ml 算法?)与数据框一起使用,我需要将我的数据框设置为某种形状:(id, vector[]) 或类似的东西。如何应用正确的转换将常规表(存储在 df 中)转换为所需的结构? 这是我的 df:

from pyspark import SparkConf
from pyspark import SparkContext


conf = SparkConf()
sc = SparkContext(conf=conf)
from pyspark.sql import SparkSession
spark = SparkSession \
.builder \
.appName("Python Spark SQL basic example") \
.config("spark.some.config.option", "some-value") \
.getOrCreate()
#-----------------------------
#creating DF:
l = [('user1', 2,1,4),('user2',3,5,6)]
temp_df = spark.createDataFrame(l)
temp_df.show()

+-----+---+---+---+
|   _1| _2| _3| _4|
+-----+---+---+---+
|user1|  2|  1|  4|
|user2|  3|  5|  6|
+-----+---+---+---+

我想使用:

from pyspark.ml.clustering import KMeans
kmean = KMeans().setK(2).setSeed(1)
model = kmean.fit(temp_df)

我得到:IllegalArgumentException: u'Field "features" does not exist.'

谢谢,

【问题讨论】:

    标签: python pyspark spark-dataframe apache-spark-mllib


    【解决方案1】:

    KMeans 需要vector 类型的输入列,如果没有另外配置,则应命名为features。您应该使用VectorAssembler 来组合这些功能。

    请咨询:

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-08-01
      • 2017-07-29
      • 1970-01-01
      • 2017-06-07
      • 1970-01-01
      • 2017-07-11
      • 2019-05-03
      • 2011-12-21
      相关资源
      最近更新 更多