【问题标题】:Feature Selection in dataset containing both string and numerical values?包含字符串和数值的数据集中的特征选择?
【发布时间】:2013-03-29 21:15:59
【问题描述】:

您好,我有一个大数据集,其中包含字符串和数值 例如。

用户名(str),手机(str),请求数(int),下载次数(int),.......

我有大约 200 个这样的专栏。

有没有一种方法/算法可以在特征选择期间同时处理字符串和整数? 或者我应该如何处理这个问题。

谢谢

【问题讨论】:

  • 你的问题太宽泛了。你试过什么?您需要如何处理这些数据?
  • 这是一个特定于包的问题吗?
  • 不是一个特定于包的问题,​​但是很高兴知道在这种情况下哪些包有帮助。我有一个如上所述的数据,每一列都是整数和字符串类型的特征(总共 200 个特征)。我想了解所有功能对“下载(布尔 0/1)”的贡献。所以我只想选择那些影响“下载”的功能。我猜大多数特征选择算法只接受实数作为输入。

标签: python machine-learning weka rapidminer feature-selection


【解决方案1】:

特征选择算法根据不同特征在分类中的影响为它们分配权重。据我所知,在计算不同的权重时,特征类型并没有什么不同。我建议根据其 ASCII 代码或任何其他技术将字符串特征转换为数字。然后就可以使用rapid miner中已有的特征选择算法了。

【讨论】:

    【解决方案2】:

    您可以在 RapidMiner 的属性加权组中使用一组运算符。例如,相关权重或信息增益权重。

    这些将根据属性与标签的相关性(在本例中为下载标志)评估赋予属性的权重。然后可以将生成的权重与 Select by Weights 运算符一起使用,以消除那些不需要的权重。这种方法自己考虑属性。

    您还可以构建分类模型并使用前向选择运算符来添加越来越多的属性并监控性能。这种方法会考虑属性之间的关系。

    【讨论】:

      【解决方案3】:

      我使用了 Weka 特征选择,虽然我尝试过的属性评估器方法无法处理字符串属性,但您可以在 Preprocess > Filter > Unsupervised > Attribute > RemoveType 中临时删除它们,然后执行特征选择,然后再次包含字符串以进行分类。

      【讨论】:

        猜你喜欢
        • 2019-10-22
        • 2014-02-05
        • 2021-12-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2021-12-13
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多