【问题标题】:Split Time Series pySpark data frame into test & train without using random split在不使用随机拆分的情况下将时间序列 pySpark 数据帧拆分为测试和训练
【发布时间】:2019-01-17 06:23:59
【问题描述】:

我有一个火花时间序列数据框。我想把它分成 80-20(训练测试)。由于这是一个时间序列数据框,我不想进行随机拆分。我该如何做才能将第一个数据帧传递给火车,第二个数据帧进行测试?

【问题讨论】:

标签: python pyspark apache-spark-sql rdd


【解决方案1】:

您可以使用pyspark.sql.functions.percent_rank() 来获取按时间戳/日期列排序的 DataFrame 的百分位排名。然后选择所有带有rank <= 0.8 的列作为您的训练集,其余的作为您的测试集。

例如,如果您有以下 DataFrame:

df.show(truncate=False)
#+---------------------+---+
#|date                 |x  |
#+---------------------+---+
#|2018-01-01 00:00:00.0|0  |
#|2018-01-02 00:00:00.0|1  |
#|2018-01-03 00:00:00.0|2  |
#|2018-01-04 00:00:00.0|3  |
#|2018-01-05 00:00:00.0|4  |
#+---------------------+---+

您需要训练集中的前 4 行和训练集中的最后一行。先添加一列rank

from pyspark.sql.functions import percent_rank
from pyspark.sql import Window

df = df.withColumn("rank", percent_rank().over(Window.partitionBy().orderBy("date")))

现在使用rank 将您的数据拆分为traintest

train_df = df.where("rank <= .8").drop("rank")
train_df.show()
#+---------------------+---+
#|date                 |x  |
#+---------------------+---+
#|2018-01-01 00:00:00.0|0  |
#|2018-01-02 00:00:00.0|1  |
#|2018-01-03 00:00:00.0|2  |
#|2018-01-04 00:00:00.0|3  |
#+---------------------+---+

test_df = df.where("rank > .8").drop("rank")
test_df.show()
#+---------------------+---+
#|date                 |x  |
#+---------------------+---+
#|2018-01-05 00:00:00.0|4  |
#+---------------------+---+

【讨论】:

  • @pault 这种问题可以用row_number 函数吗
  • @User12345 可以,但还需要知道行数。
  • @pault .count() 不会告诉你行数吗?
  • 是的,但是您必须先运行count(),这需要遍历整个 DataFrame 一次。然后你必须在过滤之前分配一个row_number()(昂贵)。使用percent_rank() 应该更有效。
  • @pault 是否有执行拆分的方法,因此不会出现此警告? “警告 WindowExec:没有为 Window 操作定义分区!将所有数据移动到单个分区,这可能会导致严重的性能下降”
猜你喜欢
  • 2016-12-01
  • 2018-09-08
  • 2018-05-26
  • 2019-08-04
  • 2019-05-10
  • 2020-09-27
  • 2018-04-22
  • 1970-01-01
相关资源
最近更新 更多