【问题标题】:Why Information gain feature selection gives zero scores为什么信息增益特征选择给出零分
【发布时间】:2016-01-30 06:41:50
【问题描述】:

我有一个数据集,我在其中使用 WEKA 中的信息增益特征选择方法来获取重要特征。下面是我得到的输出。

Ranked attributes:
0.97095    1 Opponent
0.41997   11 Field_Goals_Made
0.38534   24 Opp_Free_Throws_Made
0.00485    4 Home
0          8 Field_Goals_Att
0         12 Opp_Total_Rebounds
0         10 Def_Rebounds
0          9 Total_Rebounds
0          6 Opp_Field_Goals_Made
0          7 Off_Rebounds
0         14 Opp_3Pt_Field_Goals_Made
0          2 Fouls
0          3 Opp_Blocks
0          5 Opp_Fouls
0         13 Opp_3Pt_Field_Goals_Att
0         29 3Pt_Field_Goal_Pct
0         28 3Pt_Field_Goals_Made
0         22 3Pt_Field_Goals_Att
0         25 Free_Throws_Made

这告诉我所有得分为 0 的特征都可以忽略,对吗?

现在,当我在 WEKA 中尝试 Wrapper 子集评估时,我得到了在信息增益方法中被忽略的选定属性(即其分数为 0)。下面是输出

Selected attributes: 3,8,9,11,24,25 : 6
                 Opp_Blocks
                 Field_Goals_Att
                 Total_Rebounds
                 Field_Goals_Made
                 Opp_Free_Throws_Made
                 Free_Throws_Made

我想明白,被信息增益忽略的属性被包装子集评估方法强烈考虑的原因是什么?

【问题讨论】:

    标签: machine-learning artificial-intelligence weka feature-selection


    【解决方案1】:

    要了解发生了什么,首先要了解这两种特征选择方法在做什么。

    属性的信息增益告诉您该属性为您提供了多少关于分类目标的信息。也就是说,它测量了您知道属性值和不知道属性值的情况之间的信息差异。信息的常用度量是Shannon entropy,尽管任何可以量化消息信息内容的度量都可以。

    所以信息增益取决于两件事:在知道属性值之前有多少信息可用,以及之后有多少可用信息。例如,如果您的数据只包含一个类,那么您在没有看到任何属性值的情况下就已经知道该类是什么,并且信息增益将始终为 0。另一方面,如果您没有可以开始的信息(因为您要预测的类别在您的数据中以等量表示),并且一个属性将数据完美地拆分为类别,其信息增益将为 1。

    在这种情况下需要注意的重要一点是,信息增益是一种纯粹的信息理论度量,它不考虑任何实际的分类算法

    这就是 包装方法 的不同之处。它不是从信息论的角度分析属性和目标,而是使用实际的分类算法来构建具有属性子集的模型,然后评估该模型的性能。然后它尝试不同的属性子集并再次执行相同的操作。训练模型表现出最佳经验性能的子集获胜。

    这两种方法会给出不同结果的原因有很多(此列表并不详尽):

    • 分类算法可能无法利用属性可以提供的所有信息。
    • 分类算法可以在内部实现自己的属性选择(例如决策树/森林学习器这样做),它考虑的子集小于属性选择将产生的子集。
    • 单个属性可能不提供信息,但它们的组合可能提供信息(例如,ab 可能没有单独的信息,但另一方面,a*b 可能)。属性选择不会发现这一点,因为它单独评估属性,而分类算法可能能够利用这一点。
    • 属性选择不按顺序考虑属性。例如,决策树使用一系列属性,虽然b 可以自己提供信息,但它可能不提供除a 之外的任何信息,a 在树的较高位置使用。因此,b 在根据信息增益进行评估时会显得很有用,但不会被首先“知道”a 的树使用。

    在实践中,使用包装器进行属性选择通常是一个更好的主意,因为它会考虑您要使用的实际分类器的性能,并且不同的分类器在信息使用方面差异很大。信息增益等与分类器无关的措施的优势在于它们的计算成本要低得多。

    【讨论】:

      【解决方案2】:

      在过滤技术中(此处为信息增益),特征被认为是彼此隔离的,因此当单独考虑时 IG 为 0

      但在某些情况下,一项功能需要另一项功能 提高准确性,因此当与其他特征一起考虑时,它会产生预测价值。

      希望这会有所帮助并准时:)

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2010-12-23
        • 2015-11-03
        • 2015-09-30
        • 1970-01-01
        • 2021-01-28
        • 2017-04-07
        • 2010-12-27
        相关资源
        最近更新 更多