【发布时间】:2021-04-15 10:25:08
【问题描述】:
我正在使用this 教程来了解在效果编码变量之后必须如何解释系数。如果我有一个名为 Gender 的两级变量,如下所示:
levels(data$gender)
[1] "F" "M"
然后使用两级效果编码预测器,R 将选择最后一个级别作为参考水平,这样 M 将被视为参考水平。 如果我有一个三级变量会发生什么,例如:
levels(data$gender)
[1] "F" "M" "T"
本教程在我的示例中的意思是,如果我指定这应该在 R 中进行效果编码,那么 R 将使用 T 作为参考级别/对比组,并给我两个效果编码的回归量 Gender1和回归表中的 Gender2。
如果 T 现在是参考水平,这就是回归表:
| Estimate | SE | z-value | |
|---|---|---|---|
| (Intercept) | -0.93189 | 0.54697 | -1.704 |
| Gender1 | 0.25600 | 0.48660 | 0.526 |
| Gender2 | 0.03362 | 0.35100 | 0.096 |
那么与大均值相比,Gender1 的系数会是 F 的系数吗?和 Gender2 那个 M 反对大均值?
感谢您的宝贵时间。
编辑:这只是我想出的一个随机示例,但假设我正在研究科目的性别对他们是否被一所艰难的学校录取的影响。结果变量将是二进制的。回归表也是我工作中随机回归表中的随机数。我只是想知道这是如何工作的,并没有具体的例子。
【问题讨论】:
-
你的结果变量是什么?你能提供你为获得估计而编写的代码吗?
-
您好,感谢您的评论。我已根据您的建议编辑了我的问题。
标签: r logistic-regression categorical-data