【发布时间】:2018-03-26 22:47:00
【问题描述】:
我在 pyspark 中有一个数据框。这是它的样子,
+---------+---------+
|timestamp| price |
+---------+---------+
|670098928| 50 |
|670098930| 53 |
|670098934| 55 |
+---------+---------+
我想用之前的状态来填补时间戳的空白,这样我就可以得到一个完美的集合来计算时间加权平均值。输出应该是这样的 -
+---------+---------+
|timestamp| price |
+---------+---------+
|670098928| 50 |
|670098929| 50 |
|670098930| 53 |
|670098931| 53 |
|670098932| 53 |
|670098933| 53 |
|670098934| 55 |
+---------+---------+
最终,我想将这个新数据帧保存在磁盘上并可视化我的分析。
如何在 pyspark 中执行此操作? (为简单起见,我只保留了 2 列。在填补空白之前,我的实际数据框有 89 列,约 6.7 亿条记录。)
【问题讨论】:
-
你可以用 scipy 进行插值。我不太确定 PySpark 能做你想做的事
-
@cricket_007 spark 无法做到这一点。 Veenit,我不知道你为什么要这么做?
-
@eliasah 我正在尝试创建一个数据框,其中包含每个时间戳(最低级别粒度)的记录,这样如果我想进行时间加权平均,这非常方便。
标签: apache-spark pyspark