【问题标题】:How can I normalize dataframe in pyspark?如何在 pyspark 中规范化数据框?
【发布时间】:2020-10-04 04:05:33
【问题描述】:

我正在尝试规范化用户项目矩阵,但我想使用这个公式:

(df.values-df.values.min())/(df.values.max()-df.values.min())

在Dataframe like this.

【问题讨论】:

    标签: pyspark normalization standardized


    【解决方案1】:

    您可以创建一个函数并在其他函数中同样重用---

    def compute_function(df):
      _count = (df.values-df.values.min())/(df.values.max()-df.values.min())
      df = df.withColumn("new_column", F.lit(_count))
      return df
    
    df = compute_function(df)
    df.show()
    

    【讨论】:

      猜你喜欢
      • 2021-11-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-08-01
      • 2020-07-19
      • 2020-07-09
      • 2021-10-03
      • 2020-07-22
      相关资源
      最近更新 更多