【问题标题】:When to use one-hot encoding and when to use dummy variable?何时使用 one-hot 编码以及何时使用虚拟变量?
【发布时间】:2017-11-24 00:50:00
【问题描述】:

我有一个简短的问题。我想知道何时以及在什么情况下使用 one-hot 编码以及何时应该使用虚拟变量。

我打算对分类变量和数值变量进行聚类分析。我在一个论坛上读到,我可以尝试使用 one-hot 编码对分类变量进行编码。但我想知道是什么使它与虚拟变量不同。

谢谢

【问题讨论】:

  • 在我看来是一回事。 One-hot 编码变量是虚拟变量是same
  • 我也想知道 one-hot 编码和虚拟变量之间的区别是什么?在 ML 中使用 one-hot 编码而在统计中使用虚拟变量是否只是一个术语? (有点像特征与预测器)。

标签: machine-learning statistics cluster-analysis


【解决方案1】:

主要区别在于虚拟编码通常会删除其中一列。例如。具有 3 个级别的变量将获得 2 个虚拟变量和 3 个单热编码变量。这是为了确保您没有多重共线性。 One-hot-encoding 有时也称为 full dummy encoding

【讨论】:

    【解决方案2】:

    大多数聚类算法都是基于距离的。

    任何这样的编码都是一种使分类数据看起来像数字的技巧,但这只会推迟产生的问题:如何规范化、加权、去相关和组合特征。

    对于大多数聚类算法,无论您将虚拟编码为 0,1、0,100000 还是 0,0.000001,都会产生巨大的差异。那么你应该使用哪一个呢?对此没有客观的数学答案,这会导致严重的问题。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-07-31
      • 2020-09-18
      • 2019-08-13
      • 2020-06-23
      • 1970-01-01
      • 2019-06-28
      • 2018-10-31
      • 2018-05-09
      相关资源
      最近更新 更多