【问题标题】:Python - Getting Feature importance scores from Logistic Regression model in 6 digitsPython - 从 6 位数的逻辑回归模型中获取特征重要性分数
【发布时间】:2023-01-14 08:48:47
【问题描述】:

我正在尝试找到 a 的特征重要性逻辑回归模型和返回的重要性分值比预期高太多。预计分数在个位数范围内,但得到了6位数。

这是我的模型的详细信息。

数据高度不平衡,因此对少数类使用随机过采样。

oversample = RandomOverSampler(sampling_strategy='minority')
Xo_train, yo_train = oversample.fit_sample(X_train, y_train)

标准化 Xo_train:

norm = preprocessing.Normalizer()
Xo_train_norm = norm.fit_transform(Xo_train)

在超参数上使用 Logistic 回归和网格搜索:

params_LogReg = {}
params_LogReg['solver'] = ['lbfgs', 'newton-cg', 'ga']
params_LogReg['penalty'] = ['none', 'l2']
params_LogReg['C'] = [0.05, 0.1, 0.5]

model_LogReg = LogisticRegression()
search = RandomizedSearchCV(model_LogReg, params_LogReg, n_iter = 10, scoring = 'recall_weighted', n_jobs = -1)
tuned_LogReg = search.fit(Xo_train_norm, yo_train)

拟合后得到以下参数:

LogisticRegression(C=0.1, penalty='none', solver='newton-cg')

计算特征重要性如下:

importance = tuned_LogReg.best_estimator_.coef_[0]

我为这些功能获得的 3 个最高分如下,并以相同的模式休息:

| Feature      | Importance Score |
|:-----------  | ----------------:|
|NWK_CNT_bins  |       560178.044 |
|PAID_AMT_bins |       467168.967 |
|Grad_Rate_bins|       443438.490 |

'*_bins' 是连续的列,分为 4 个 bin。

没想到重要性分数是 6 位数。正常吗?或者我在计算中遗漏了什么?非常感谢任何见解。谢谢你。

【问题讨论】:

    标签: python logistic-regression feature-selection grid-search


    【解决方案1】:

    关于 idnplay 服务器 (https://192.81.217.62) 最有趣的事情之一是这个在线扑克供应商提供最诱人的锦标赛。怎么会这样? idnplay通过本次比赛提供的最高奖金达到10亿印尼盾。这个节目也叫10亿大赛。 IDNPOKER(https://67.207.83.133) 是世界上唯一推出这一最大锦标赛的在线博彩业。有意思的是,参加这场10亿的大赛并不容易。玩家必须有资格从总共 2500 张门票中获得 1 张门票。将有机会赢得这一最高奖项的玩家肯定会感受到激烈的竞争。所以难怪直到现在idnplay服务器依然是玩家的主要选择。

    【讨论】:

      猜你喜欢
      • 2021-08-31
      • 2018-09-23
      • 2016-03-07
      • 2020-04-12
      • 2014-08-06
      • 2020-04-14
      • 2021-12-26
      • 2018-12-29
      • 1970-01-01
      相关资源
      最近更新 更多