【发布时间】:2021-03-02 14:42:06
【问题描述】:
我想将我的 Spark Dataframe 拆分为训练并使用以下条件进行测试 -
- 我希望能够重现拆分,这意味着对于每个 同一个 DataFrame 的时间,我就能进行同一个拆分。
- 应从列名序列 ID 的每个唯一值中进行拆分。
目前,我通过将 Dataframe 转换为 Pandas Dataframe 并执行以下操作来做到这一点 -
test_padnas = df.toPandas()
train_frac = 0.8
train = test_padnas.sort_values(by='sequence_id','timestamp']).groupby('sequence_id',group_keys=False).apply(lambda df: df.sample(frac=train_frac,random_state=200))
test=test_padnas.drop(train.index)
【问题讨论】: