【问题标题】:How to use Dataframes in pyspark machine learning?如何在 pyspark 机器学习中使用 Dataframes?
【发布时间】:2017-07-29 20:14:35
【问题描述】:

我已经简要了解了如何使用 RDD 构建 ML 模型,但过去我通常使用数据框构建我的 ML 模型。我知道 spark.ml 是用于 spark 机器学习的 DataFrame API,但我无法找到有关如何使用它的示例。

我的问题是您能否提供一个示例,说明如何使用 Dataframe 构建 Spark 机器学习模型?

附:抱歉,如果这个问题不合适,不知道在哪里发布。

【问题讨论】:

    标签: python dataframe machine-learning pyspark


    【解决方案1】:

    这是我刚才快速编写的一个简单示例。

    import pyspark.ml                as ml
    import pyspark.ml.feature        as ft
    import pyspark.ml.classification as cl
    
    data = sc.parallelize([
         (1, 'two',  3.4, 0)
        ,(2, 'four', 9.1, 1)
        ,(3, 'one',  2.1, 0)
        ,(4, 'five', 2.6, 0)
    ]).toDF(['id', 'counter', 'continuous', 'result'])
    
    si  = ft.StringIndexer(inputCol='counter', outputCol='counter_idx')
    ohe = ft.OneHotEncoder(inputCol=si.getOutputCol(), outputCol='counter_enc')
    va  = ft.VectorAssembler(inputCols=['counter_enc', 'continuous'], outputCol='features')
    
    lr  = cl.LogisticRegression(maxIter=5, featuresCol='features', labelCol='result')
    
    pip = ml.Pipeline(stages=[si, ohe, va, lr])
    pip.fit(data).transform(data).select(data.columns+['probability', 'prediction']).show()
    

    您也可以查看 Denny's 和我的书的笔记本:https://github.com/drabastomek/learningPySpark/blob/master/Chapter06/LearningPySpark_Chapter06.ipynb

    希望这会有所帮助。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-12
      • 2015-12-02
      • 2019-06-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多