【发布时间】:2017-10-29 16:52:13
【问题描述】:
我有一个数据集,其中包含 7 个不同的协变量和一个输出变量,即“成功率”。 我试图找到预测成功率的重要因素。我的数据集中的协变量之一是一个分类变量,它有 700 个值(0-700),每个值代表他们来自的地区的 ID。 在执行逻辑回归时我应该如何处理这个变量? 如果我制作 700 个虚拟列,我怎样才能更容易解释结果? 我正在使用 Python 和 statsmodels。
【问题讨论】:
-
添加数据。我们不需要解释。我们需要数据。在不知道数据长什么样的情况下,我们可以提出什么建议?
标签: python pandas regression statsmodels