【问题标题】:Does Quasi Separation matter in R binomial GLM?准分离在 R 二项式 GLM 中是否重要?
【发布时间】:2016-06-01 01:45:51
【问题描述】:

我正在学习准分离如何影响 R 二项式 GLM。我开始认为这在某些情况下并不重要。

在我的理解中,我们说数据是准分离的,当 一些因素水平的线性组合可以完全识别失败/非失败。

所以我在 R 中创建了一个具有准分离的人工数据集:

fail <- c(100,100,100,100)
nofail <- c(100,100,0,100)
x1 <- c(1,0,1,0)
x2 <- c(0,0,1,1)
data <- data.frame(fail,nofail,x1,x2)
rownames(data) <- paste("obs",1:4)

然后,当 x1=1 和 x2=1 (obs 3) 时,数据始终不会失败。 在这个数据中,我的协变量矩阵有三列:intercept、x1 和 x2。

在我的理解中,准分离会导致无限价值的估计。所以 glm fit 应该失败。但是,以下 glm fit 不会失败:

summary(glm(cbind(fail,nofail)~x1+x2,data=data,family=binomial))

结果是:

Coefficients:
            Estimate Std. Error z value Pr(>|z|)    
(Intercept)  -0.4342     0.1318  -3.294 0.000986 ***
x1            0.8684     0.1660   5.231 1.69e-07 ***
x2            0.8684     0.1660   5.231 1.69e-07 ***
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

标准。即使使用准分离,错误似乎也很合理。 谁能告诉我为什么准分离不影响 glm 拟合结果?

【问题讨论】:

    标签: r glm logistic-regression mle


    【解决方案1】:

    您构建了一个有趣的示例,但您没有测试一个模型,该模型实际上检查了您描述为准分离的情况。当您说:“当 x1=1 和 x2=1 (obs 3) 时,数据总是失败。”,您是在暗示模型中需要一个交互项。请注意,这会产生“更有趣”的结果:

    > summary(glm(cbind(fail,nofail)~x1*x2,data=data,family=binomial))
    
    Call:
    glm(formula = cbind(fail, nofail) ~ x1 * x2, family = binomial, 
        data = data)
    
    Deviance Residuals: 
    [1]  0  0  0  0
    
    Coefficients:
                  Estimate Std. Error z value Pr(>|z|)
    (Intercept) -1.367e-17  1.414e-01   0.000        1
    x1           2.675e-17  2.000e-01   0.000        1
    x2           2.965e-17  2.000e-01   0.000        1
    x1:x2        2.731e+01  5.169e+04   0.001        1
    
    (Dispersion parameter for binomial family taken to be 1)
    
        Null deviance: 1.2429e+02  on 3  degrees of freedom
    Residual deviance: 2.7538e-10  on 0  degrees of freedom
    AIC: 25.257
    
    Number of Fisher Scoring iterations: 22
    

    人们通常需要非常怀疑 2.731e+01 的 beta 系数:隐含优势比 i:

     > exp(2.731e+01)
    [1] 725407933166
    

    在这种工作环境下,Inf 和 725,407,933,166 确实没有本质区别。

    【讨论】:

    • 是的,并注意该术语的 Wald 标准误差 (5.2e4)(这是 Hauck-Donner 效应)。如果你愿意,你可以用brglm::brglm()logistf::logistf()rms::lrm()(带有penalty参数集)、arm::bayesglm()、...
    • @BenBolker 我是否应该发布一个问题,要求学习答案以帮助我(以及任何其他统计学学生)记住 H-D 和 Q-S 之间的区别?它们都与数学上荒谬的参数估计相关,但它是否像这样简单:QS 与高 coef()'s ... HD 与膨胀 sem()'s 相关联?
    • 请问如何准确和实际地检查数据是否包含准分离?是否足以检查我是否找到了一些标量 s 和列向量 x 使得 x[i] >= s 然后 Y_i = 0 和 x[i]
    • 认为,但不确定 H-D 是指在“极端”(但不一定完全准分离?)参数值的情况下 Wald 近似的失败二项式 GLM。你可以问(但我认为 CrossValidated 会比 SO 更好)
    • 这是有道理的。在上面的示例中,尽管模型拟合完美,但没有一个 Wald 检验接近显着。
    猜你喜欢
    • 2020-09-03
    • 2016-09-07
    • 1970-01-01
    • 1970-01-01
    • 2018-10-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-03-31
    相关资源
    最近更新 更多