【发布时间】:2019-07-27 01:23:21
【问题描述】:
假设我有一个带有(90,000 x 17) 的数据集,即(n x p),其中n 是number of observations,p 是number of variables,我想从20% 的行中随机抽取样本我的整个数据集如何在 R 中完成?
随机抽取样本后,我将进行相应的聚类分析。
我曾尝试使用其他问题来回答我的问题,但它们没有定论,因为它没有给我我需要的东西。
【问题讨论】:
-
sample()重复采样会有所帮助 -
df[sample(nrow(df), nrow(df)*0.2),] -
记住要修复种子
set.seed(1492)(或任何数字)以获得样品的重现性!