【发布时间】:2015-02-21 00:06:21
【问题描述】:
我有一个包含连续变量和分类变量的数据集。最后我想建立一个逻辑回归模型来计算响应二分变量的概率。
将对数线性模型应用于模型中的分类变量以测试它们的相互作用,然后将指示的相互作用用作逻辑模型中的预测变量,是否可以接受,甚至是一个好主意?
R 中的示例:
df 中的列:CategoricalA、CategoricalB、CategoricalC、CategoricalD、CategoricalE、ContinuousA、ContinuousB、ResponseA
library(MASS)
#Isolate categorical variables in new data frame
catdf <- df[,c("CategoricalA","CategoricalB","CategoricalC", "CategoricalD", "CategoricalE")]
#Create cross table
crosstable <- table(catdf)
#build log-lin model
model <- loglm(formula = ~ CategoricalA * CategoricalB * CategoricalC * CategoricalD * CategoricalE, data = crosstable)
#Use step() to build better model
automodel <- step(object = model, direction = "backward")
然后使用automodel的输出以及ContinuousA和ContinuousB的值构建逻辑回归,以预测ResponseA(二进制)。
我的预感是这样不好,但我无法以一种或另一种方式明确地找到答案。
【问题讨论】:
-
可能 stats.stackexchange.com 是解决这个问题的更好论坛。
-
同意罗伯特的观点,但要补充一点,这两个模型都是在对数尺度上估计的,并且应该就“重要性”提供类似的答案。正如 MASS 文档中所指出的,您可以使用普通的
glm来构建对数线性模型,然后使用predict.glm在一个框架内完成所有工作。
标签: r statistics regression logistic-regression