【问题标题】:Is this correct way to estimate bootstrap SD?这是估计引导 SD 的正确方法吗?
【发布时间】:2016-01-06 09:41:16
【问题描述】:
set.seed(1)
norm = rnorm(10000000, 10, 50) # "population" which is unknown

norm1 = sample(norm, 1000, replace = FALSE) # Random sample

norm2 = replicate(10000, {      
  x = sample(norm1, 1000, replace = TRUE)      
  sd(x)      
})

mean(norm2)

返回 49.91 的平均 SD。我认为引导程序会比样本返回更接近总体的估计值。难道我做错了什么?

【问题讨论】:

    标签: r


    【解决方案1】:

    您已经计算了样本的 sd(即 50),而不是 bootstrap sd。

    set.seed(1)
    norm <- rnorm(10000000, 10, 50)                # population which is unknown
    
    # This line is not needed
    # norm1 = sample(norm, 1000, replace = FALSE)  # Random sample
    
    norm2 <- replicate(10000, {      
      x <- sample(norm, 1000, replace = TRUE)      # Take a sample of norm (not of norm1)
      x                                            # Don't calculate the sd here
    })
    
    # Calculate the mean of each sample
    sample_means <- apply(norm2, 2, mean)
    
    # Calculate the sd of the sample means
    sd(sample_means)
    

    【讨论】:

    • 这导致 SD 为 1.59。我预计它会接近 50,这是人口 SD。我认为 bootstrap 的想法是对人口进行估计。
    • 另外,如果我跳过 norm1,我会从未知的“人口”中抽样。这就是我第一次取样的原因。
    • @Jixxi; bootstrapping 假设您的样本 (norm1) 是总体,因为在实践中您不会知道未知总体 (norm)。所以检查mean(norm1) - 应该接近mean(norm2)。然而,这只是检查自举过程中的偏差。 BS 实际上更常用于生成统计信息的置信区间(在本例中为 sd)。 (要以您的方式检查这一点,您需要对 norm1 重新采样,(由于 norm1 的抽取中的采样变化,但这就是我们通过自举计算置信区间的原因。)
    猜你喜欢
    • 2012-02-16
    • 1970-01-01
    • 1970-01-01
    • 2013-09-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-02-16
    • 1970-01-01
    相关资源
    最近更新 更多