【问题标题】:Model Analysis IN R ( Logistic Regression)R中的模型分析(逻辑回归)
【发布时间】:2016-12-11 08:59:39
【问题描述】:

我有一个数据文件(100 万行),其中有一个结果变量作为状态(是/否),其中包含三个连续变量和 5 个名义变量(每个变量中有 5 个类别) 我想预测结果,即状态。 我想知道哪种类型的分析有利于建立模型。 我见过logit,probit,逻辑回归。我对从什么开始和分析更有可能对分析有用的变量感到困惑。

数据文件: 性别、地区、年龄、公司、专业、工作、诊断、实验室、订单、状态

M,west,41,PA,FPC, Assistant,code18,27,3,yes

M,Southwest,65,CV,FPC,Worker,code18,69,11,no

M,South,27,DV,IMC,Assistant,invalid,62,13,no

M,Southwest,18,CV,IMC,Worker,code8,6,1,yes

PS:使用 R 语言。 任何帮助将不胜感激谢谢!

【问题讨论】:

  • 如果您在模型选择方面需要帮助,您应该在Cross Validated 询问有关主题的统计问题(您想在“R”中执行此操作并不重要)。一旦你知道要使用什么模型,那么你应该能够在 R 中搜索如何做到这一点。
  • 尝试用虚拟变量搜索多元回归,这个问题更适合交叉验证。
  • C5.0 这样的决策树算法在涉及连续变量和名义变量组合的二元分类任务中非常强大。

标签: r statistics prediction logistic-regression mlogit


【解决方案1】:

鉴于这三个,大多数情况下通常从逻辑回归开始分析。

请注意,Logistic 和 Logit 是一回事。

在选择 Logistic 和 Probit 时,请选择 Logistic。

Probit 通常更快地返回结果,而 Logistic 在解释结果方面具有更好的优势。

现在,确定变量 - 您可以改变要在模型中使用的变量数量。

model1 <- glm(status ~., data = df, family = binomial(link = 'logit'))

现在,检查模型摘要并检查预测变量的重要性。

model2 <- glm(status ~ gender + region + age + company + speciality + jobrole + diag + labs, data = df, family = binomial(link = 'logit'))

通过减少变量的数量,您将能够更好地确定哪些变量是重要的。

此外,请确保您在此之前已执行数据清理。

避免包含高度相关的变量,您可以使用cor()检查它们

【讨论】:

    猜你喜欢
    • 2021-04-28
    • 1970-01-01
    • 2018-01-26
    • 2016-08-17
    • 2012-11-19
    • 2018-01-26
    • 2014-06-08
    • 1970-01-01
    • 2020-07-16
    相关资源
    最近更新 更多