【发布时间】:2013-06-24 11:53:11
【问题描述】:
我有一个包含 2000 个人的数据集。对于每个人 i:2000 ,数据集包含 n 重复的情况。让d 表示这个数据集,d 的每一行都由i 和n 索引。在其他变量中,d 有一个变量pid,它对不同(情况)行中的个人具有相同的值。
考虑到数据的面板性质,我想重新采样d(如引导程序):
- 有替换,
- 将每个重采样数据存储为一个数据框
我考虑过使用sample 函数,但无法使其工作。我是 r 的新用户,没有编程技能。
数据集由许多变量组成,但所有变量都有数值。数据集如下。
pid x y z
1 10 2 -5
1 12 3 -4.5
1 14 4 -4
1 16 5 -3.5
1 18 6 -3
1 20 7 -2.5
2 22 8 -2
2 24 9 -1.5
2 26 10 -1
2 28 11 -0.5
2 30 12 0
2 32 13 0.5
前六行是第一人的,pid=1,接下来的性别行,pid=2是第二人的不同观察。
【问题讨论】:
-
使用
head(d)向我们展示数据集前六行的示例。你也可以使用str(d)来检查d的结构,这样我们就知道哪些列是数字、字符串、因子等。最后,使用dput(d)(或dput(d[1:10,])),这样我们就可以轻松地在您的数据。 -
我希望这会有所帮助。我无法满足您的所有要求。
-
您要归档什么样的采样?从您的 2000 人中选择 n 个人并保留所有观察结果?为每个人选择 m 个观察值?两者的结合?
-
我希望重新采样的数据具有与原始数据相同的长度(个体数量)。那是2000个人。每个人有 n 个观察值,如果一个人在重新采样的数据中,那么他或她的所有 n 个观察值也是如此。
标签: r