【问题标题】:Random Sample of rows from an R dataset [duplicate]来自 R 数据集的随机行样本 [重复]
【发布时间】:2019-07-27 01:23:21
【问题描述】:

假设我有一个带有(90,000 x 17) 的数据集,即(n x p),其中nnumber of observationspnumber of variables,我想从20% 的行中随机抽取样本我的整个数据集如何在 R 中完成?

随机抽取样本后,我将进行相应的聚类分析。

我曾尝试使用其他问题来回答我的问题,但它们没有定论,因为它没有给我我需要的东西。

【问题讨论】:

  • sample() 重复采样会有所帮助
  • df[sample(nrow(df), nrow(df)*0.2),]
  • 记住要修复种子set.seed(1492)(或任何数字)以获得样品的重现性!

标签: r dataframe sampling


【解决方案1】:

您可以使用来自dplyrsample_frac 来完成,这里是一个使用数据库 iris 的示例

 library(dplyr)
 #data(iris)
 sample20 <- iris %>% sample_frac(0.2)

【讨论】:

    猜你喜欢
    • 2012-03-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-09-15
    • 2010-09-19
    • 2019-01-12
    • 2013-05-01
    • 1970-01-01
    相关资源
    最近更新 更多