【问题标题】:How to find out which data sets destroy my data analysis using MATLAB?如何找出哪些数据集破坏了我使用 MATLAB 进行的数据分析?
【发布时间】:2012-07-13 20:32:56
【问题描述】:

我有 200 个样本,每个样本有 60 个特征。我使用 PCA 来查找主成分。我用了神经网络,也尝试了k近邻,但是分类结果并不好。我不介意取出一些样本,但我怎么知道哪些样本破坏了我的分类结果?我知道我可以一一尝试,但它会非常无效。请帮忙

【问题讨论】:

  • 您可以从剔除异常值开始,可能是与平均值相差超过 2 或 3 个标准差的任何值。不过,这取决于您的数据...

标签: matlab analytics cluster-analysis


【解决方案1】:

你需要扔掉一些属性,而不是扔掉一些样本。

PCA 计算一个具有 d x d 个条目的矩阵。在 60 个属性中,这个矩阵有 3600 个条目。你只有 200 个样本来计算这个矩阵的内容——难怪结果几乎是随机的。您需要更少的变量和更多的数据。

【讨论】:

    【解决方案2】:

    这是一个经典的机器学习问题。只有 200 个样本,如此多的特征(在您的情况下为 60 个)总是存在风险。请检查您是否有多余的功能。举个例子吧

    想象一下,我们必须从以下特征来预测房价 1. 尺寸m2 2.卧室数量 3. 宅龄 4. 尺码2

    请注意,这里的 2 号和 4 号特征都提供了相同的信息,并且它们是多余的。起初它看起来并不那么令人不安。但是,如果您有这样的数据,最好删除这些功能。

    因此,我建议您先查看功能,然后再查看数据。有关更多详细信息,您可以在 coursera 中查看斯坦福大学的机器学习课程(由 Ng 教授教授)

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2017-05-18
      • 2020-02-17
      • 2014-10-23
      • 1970-01-01
      • 2011-11-27
      • 1970-01-01
      • 2017-02-04
      • 1970-01-01
      相关资源
      最近更新 更多