【发布时间】:2018-07-19 19:02:16
【问题描述】:
我在一个数据集上使用scikit-learn LogisticRegression,其中因变量是一个具有 10 个可能值(标记为 1 到 10)的分类变量。我的统计知识相当初级。
每个输出值的概率本质上受到它们必须总和为1 的要求的限制,我对数学的理解是需要有一个reference category(例如最可能的类别)并且然后将其他 9 个结果中的每一个的概率表示为相对于参考类别的概率,因此每个解释变量实际上有 9 个系数(而不是 10 个)。
我不清楚这是否是由LogisticRegression.fit() 方法自动完成的,如果是这样,它是否假定第一个类别是参考(1)?
还是我需要以某种方式处理输入数据,所以只有 9 个类别?
还是我忽略这一点并在输出时使用 10 个系数?
【问题讨论】:
-
据我所知,您必须在使用
LogisticRegression.fit()之前创建虚拟变量,否则fit函数会将分类变量视为连续变量。 -
我认为虚拟变量用于独立(解释)变量,而不是因变量。
-
抱歉,我看错了你的问题。
标签: python scikit-learn logistic-regression categorical-data