【问题标题】:Clustering data after dimension reduction with PCA使用 PCA 对降维后的数据进行聚类
【发布时间】:2013-09-30 22:05:39
【问题描述】:

假设我们有一个大维度的数据集,我们使用 PCA 将其减少到一个较低维度,然后对所述数据使用聚类算法是否明智/准确?假设我们不知道预期有多少集群。

在 Iris 数据集上使用 PCA(对 csv 中的数据进行排序,以便列出所有第一类,然后是第二类,然后是第三类)产生以下图:-

可以看出,鸢尾花数据集中的三个类都得到了保留。但是,当样本的顺序随机化时,会产生以下图:-

以上,尚不清楚数据集中包含多少个集群/类。在这种情况下(更现实的情况),如何确定类的数量,诸如 K-Means 之类的聚类算法是否有效?

会因为丢弃低阶主成分而导致不准确吗?

编辑:- 明确地说,我问的是在运行 PCA 后是否可以对数据集进行聚类,如果可以,最准确的方法是什么。

【问题讨论】:

  • 你到底画了什么?不久前我绘制了 iris 的 PCA,在前两个缩减维度(包含最大方差)上,簇是可见的。
  • 嗨,我正在绘制第一个主成分特征向量和原始(零均值)数据集的乘积。
  • 制作直方图,而不是仅仅绘制点。

标签: statistics machine-learning cluster-analysis pca


【解决方案1】:

假设我们有一个大维度的数据集,我们已将其缩减为更低的维度 使用 PCA 的维度,然后使用聚类是否明智/准确 上述数据的算法?假设我们不知道有多少簇 期待。

您的数据很可能在低方差维度中分离。我不建议在集群之前运行 PCA。

以上,不清楚数据中包含多少个簇/类 放。在这种情况下(更真实的情况),如何识别 类的数量,像K-Means这样的聚类算法会有效吗?

有一些有效的聚类算法不需要事先知道类的数量,例如 Mean Shift 和 DBSCAN。

【讨论】:

    【解决方案2】:

    尝试在 PCA 之后对数据集进行排序,然后绘制它。

    虹膜数据集非常简单,可以简单地得出关于高维数据行为的任何有效结论,以及 PCA 的好处。

    另外,“明智”——在什么意义上?如果你想吃披萨,绘制 iris 数据集是不明智的。

    【讨论】:

    • 但是在不知道顺序的情况下,会发生什么?明智/准确 - 这会产生正确的数据表示。
    • 在第一维按value排序,而不是按原来的顺序,结果会显得更好!定义“正确的表示”。真实数据中没有“正确”之类的东西。
    猜你喜欢
    • 2017-08-28
    • 2021-11-12
    • 2018-04-15
    • 2020-10-27
    • 2021-12-10
    • 1970-01-01
    • 2022-09-30
    • 1970-01-01
    • 2018-08-27
    相关资源
    最近更新 更多