【发布时间】:2019-09-18 00:47:43
【问题描述】:
我正在尝试为电信流失建立逻辑回归模型。
一些背景知识:为了预测客户流失率,我们的数据集包含 Account_Age、Current_Bill_Amount、Avg_Days_Delinquent(未付账单后的天数)、投诉、Avg_Calls 等变量数据。
我的问题与投诉变量有关。如图所示,投诉变量已转换为 5 个虚拟变量,因为有 6 个投诉类别。创建了 5 个虚拟列,将“定价”投诉排除在外。
现在,如“通话质量”的投诉图片所示,“计费问题”具有很高的绝对和百分比流失率,而其他投诉类型对流失率的贡献并不大。
图片可能不会显示在您的末尾,因此相同的链接是:https://imgur.com/88zHamt https://imgur.com/8WR19C0
关于投诉对客户流失的影响,我有 2 个问题。
问题一:
该算法不认为“通话质量”是一个重要变量,它的 P 值为 0.527。鉴于 81% 的客户(参考图片)投诉“通话质量”而流失,该算法给出了矛盾的结果。无法理解为什么会发生这种情况,通话质量肯定会影响客户流失。请分享您对此的看法。
问题2:
模型显着变量的系数 (P
如果您需要更多信息或有任何澄清,请告诉我。
import statsmodels.api as sm
logReg=sm.Logit(Y_train,X_train)
logistic_regression=logReg.fit()
logistic_regression.summary()
问题 1 和 2 的答案是预期结果。
【问题讨论】:
-
为什么系数不能为负数?
-
@erip 由于投诉虚拟变量对流失系数有积极影响,因此我认为应该是正数。
标签: python-3.x machine-learning scikit-learn logistic-regression categorical-data