【问题标题】:Machine Learning dataset with many discrete features具有许多离散特征的机器学习数据集
【发布时间】:2018-03-08 11:10:59
【问题描述】:

我正在处理一个医疗数据集,其中包含许多具有离散输出的变量。例如:麻醉类型、感染部位、糖尿病 y/n。为了解决这个问题,我刚刚将它们转换为带有 1 和 0 的多列,然后删除一列以确保它们之间没有直接相关性,但我想知道是否有更有效的方法来做到这一点

【问题讨论】:

    标签: python pandas dataframe machine-learning


    【解决方案1】:

    这取决于转换的目的。如果序数表示不符合类别的逻辑,则将类别转换为数字标签可能没有意义。在这种情况下,如果(正如我从您的帖子中推测的那样)意图是使用生成的变量作为某种回归模型的输入,那么您采用的“单热”编码方法是最好的方法。您可以使用pandas.get_dummies 实现您想要做的事情。

    【讨论】:

    • 您可以通过将参数 drop_first=True 传递给 get_dummies 来选择删除第一级
    • 为了澄清我上面的答案,无论您是一次性编码还是将标签转换为数值(例如,如果您使用随机森林等基于树的模型)都可能无关紧要。如果您使用的是传统回归方法,那么需要注意的是,从某种意义上说,答案取决于您计划使用的模型。
    猜你喜欢
    • 2015-12-17
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-12-14
    • 2014-12-27
    • 1970-01-01
    • 2012-03-28
    相关资源
    最近更新 更多