【问题标题】:what is the correct way to apply a feature selection method to an imbalanced dataset?将特征选择方法应用于不平衡数据集的正确方法是什么?
【发布时间】:2023-02-03 13:55:22
【问题描述】:

我是数据科学和机器学习的新手,所以我会详细写下我的问题。

我有一个不平衡的数据集(二进制分类数据集),我想通过使用 Weka paltform 来应用这些方法:

  1. 10 折交叉验证。
  2. SOMTE 或过采样以平衡数据。
  3. 一种Wrapper特征选择方法。
  4. 6 个分类器并比较它们的性能。

    我想在这些条件下应用它们:

    1. 在应用特征选择方法之前平衡数据 (reference)。
    2. 在交叉验证期间平衡数据 (reference)。

      正确的程序是什么?

      我在下面写了一篇带有建议程序的帖子。

【问题讨论】:

    标签: weka cross-validation feature-selection imbalanced-data k-fold


    【解决方案1】:

    这个程序正确吗?

    首先,使用特征选择方法来减少特征数量:

    1. 从预处理选项卡:平衡整个数据集。
    2. 从选择属性选项卡:将特征选择方法应用于平衡数据集。
    3. 从预处理选项卡:从原始不平衡数据集中删除未选择的属性(从步骤 #2 产生)并保存数据集的新副本以便在下面使用它。

      然后,将 coss 验证和平衡方法应用于数据集的新副本:

      1. 从分类选项卡:选择 10 折交叉验证。
      2. 选择过滤器分类器并编辑其属性:
        • 分类器(选择分类器,一一选择)。
        • 过滤器:SMOTE 或重采样。

    【讨论】:

      猜你喜欢
      • 2020-06-06
      • 1970-01-01
      • 2015-12-04
      • 2012-11-23
      • 1970-01-01
      • 1970-01-01
      • 2018-11-21
      • 2014-04-08
      • 1970-01-01
      相关资源
      最近更新 更多