【问题标题】:pyspark aggregating every n rowspyspark 每 n 行聚合一次
【发布时间】:2019-02-03 12:09:40
【问题描述】:

我是 pyspark 的新手,正在尝试重新创建我用 python 编写的代码。我正在尝试创建一个新数据框,该数据框具有来自旧数据框的每 60 个观察值的平均值。这是我在旧 python 中实现的代码:

new_df=old_df.groupby(old_df.index // 60).mean()

我正在努力解决如何使用 pyspark 在数据块中做同样的事情。

【问题讨论】:

    标签: pyspark aggregation databricks


    【解决方案1】:

    我认为如果您的数据框中有一个索引列,您可以按照您的建议执行类似的操作:

    new_df=old_df.withColumn("new_index", col(index)/60).groupBy("new_index").agg(avg(YOUR_COLUMN_FOR_AVERAGE))
    

    最好的问候,

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-10-08
      • 2010-11-18
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多