【问题标题】:How to oversample a dataframe in Pyspark?如何在 Pyspark 中对数据框进行过采样?
【发布时间】:2018-08-21 11:52:32
【问题描述】:

如何在 pyspark 中对数据帧进行过采样?

df.sample(fractions, seed)

仅对 df 的一小部分进行采样,不能过采样。

【问题讨论】:

  • 过度采样是指与原始样本相比增加样本数量吗?如果是,您打算如何通过复制记录或应用一些过采样算法来做到这一点?
  • 定义“过采样”的含义。如果合适,请尝试提供minimal reproducible example。

标签: pyspark oversampling


【解决方案1】:

您可以使用sample method 进行过度采样,如下所示:

df.sample(withReplacement=True, total_percent_of_upsample, seed)

sample(withReplacement, fraction, seed=None)

True 表示您要进行替换采样。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2020-12-30
    • 2011-10-13
    • 2015-01-31
    • 1970-01-01
    • 2020-10-23
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多