【发布时间】:2020-07-16 08:24:59
【问题描述】:
我为各种品牌和型号的汽车创建了一个关于 mpg 的逻辑回归公式。 一个变量“原产地”是整数:1=美国,2=德国,3=日本。 我把它转换成 origin.factor
head(origin.factor) [1] 美国 美国 美国 美国 美国 [6] 美国 级别:美式德语日语
首先,有人建议我使用 as.factor 将 "origin" 转换为 factor 并重新标记,但我没有看到如何使用 as 传递 label=c("American", "German", "Japanese")。因素。 有什么想法吗?
接下来,包含所有变量的初始 Logistic 模型产生了这个输出(抱歉,这篇文章中的列没有对齐,但最后一列是每个变量的粗体 p 值):
auto.mpg.logistic
调用: glm(公式 = mpg.binary ~ 气缸 + 排量 + 马力 + 重量 + 加速度 + 年份 + origin.factor, family = "binomial")
偏差残差:
最小值 1Q 中值 3Q 最大值
-2.44937 -0.08809 0.00577 0.19315 3.03363
系数:
估计标准。误差 z 值 Pr(>|z|)
(截取) -19.450793 5.956353 -3.266 0.00109 **
气缸 -0.264169 0.439645 -0.601 0.54793
位移 0.015568 0.013658 1.140 0.25434
马力 -0.043081 0.024621 -1.750 0.08017 .
重量 -0.005762 0.001376 -4.187 2.83e-05 ***
加速度 0.012939 0.142921 0.091 0.92786
年 0.495635 0.086155 5.753 8.78e-09 ***
origin.factorGerman 1.971277 0.785573 2.509 0.01210 *
origin.factorJapanese 1.102741 0.713768 1.545 0.12236
意义。代码:0''0.001''0.01''0.05'.'0.1''1
接下来,我继续删除 p 值 > 0.05 显着性水平的变量,以得到以下输出:
auto.mpg.logistic
调用: glm(公式 = mpg.binary ~ 马力 + 重量 + 年份 + origin.factor, 家庭=“二项式”)
偏差残差:
最小值 1Q 中值 3Q 最大值
-2.2675 -0.0943 0.0080 0.2007 3.2653
系数:
估计标准。误差 z 值 Pr(>|z|)
(截取)-18.240055 4.912407 -3.713 0.000205 ***
马力 -0.042209 0.016441 -2.567 0.010251 *
重量 -0.004607 0.000734 -6.276 3.47e-10 ***
年 0.457663 0.075997 6.022 1.72e-09 ***
origin.factorGerman 1.335225 0.529879 2.520 0.011740 *
origin.factorJapanese 0.628677 0.580123 1.084 0.278500
意义。代码:0''0.001''0.01''0.05'.'0.1''1
现在唯一仍然高于 0.05 显着性水平的变量是 origin.factorJapanese
所以问题是,我可以以某种方式仅删除 origin.factorJapanese 并留在 Origin.factorGerman 中,因为它很重要吗?
或者是删除 origin.factor 的适当操作,这将从我的逻辑模型中消除此分类变量的所有方面(这似乎是我唯一的选择...)?
我是 R 新手,主要根据我们的课堂作业使用基本 R 函数,因此请在您的回答中考虑这一点。 谢谢,
约翰
【问题讨论】:
标签: r logistic-regression