【问题标题】:Which algorithm or statistical method will be best?哪种算法或统计方法最好?
【发布时间】:2018-03-11 02:15:11
【问题描述】:

我有一个包含 21 名学生 (A1…A21) 和他们的 25 个特征(表 1)的表,我还有另一个矩阵(表 2),它显示一个学生是否喜欢另一个学生(0 表示喜欢,100 表示不喜欢)。

我怎样才能找到最少的没有。有哪些特征可以给我与相似度矩阵相似的空间距离?

例如: 如果我们得到具有特征 C1、C3、C4、C5、C10 的 5 个维度,那么为这些特征绘制的点 A1、..A21 将具有比例距离作为相似度矩阵。

例如,如果 A3 和 A2 在 5D 特征空间中它们之间的距离很小,那么它们在相似度矩阵中的距离/值也会相应地更小。

Table 1

Table 2

【问题讨论】:

    标签: algorithm multidimensional-array neural-network statistics deep-learning


    【解决方案1】:

    你可以把这个看起来像一个众所周知的统计问题,但是你做了假设(相似的学生互相喜欢),我会做进一步的假设,并且大多数统计问题的解决方案都不是很体面,所以你应该对结果持怀疑态度。

    如果有 21 名学生,您就有 21*20/2 = 210 对学生。将每一对视为单独的观察。你对那对有一个可爱度值。对于每一对,对于每个特征,计算两​​个学生中每个学生的值之间差异的绝对值。这为每个观察提供了一个包含 25 个元素的向量。现在,您将尝试在给定 210 个 25 长的绝对差向量的情况下预测 210 个相似度。

    此过程的名称为全子集回归和逐步回归。请参阅 https://www.r-bloggers.com/variable-selection-using-automatic-methods/https://www.r-bloggers.com/variable-selection-using-automatic-methods/。计算这些的一种方法是使用来自https://www.r-project.org/ 的免费开源统计包 R。

    对于每个可能的变量选择,您可以使用线性回归从绝对差异向量中预测喜爱度。从该线性回归中,您可以衡量预测的好坏,以及特定的变量选择是否好。所有子集回归都使用分支上的变体,并且必须为每个 N 计算出预测最佳的大小为 N 的变量集。逐步回归从可能不完整的变量选择开始,然后执行一种爬山,在每个阶段从集合中添加或减去一个变量,尝试所有变量并选择能够提供最佳预测的变量。通常,您从无变量开始,一次添加一个变量,或者从所有变量开始,一次删除一个变量。逐步选择不能保证找到所有子集回归都会找到的变量的绝对最佳选择,但所有子集回归可能非常昂贵。

    从中您将获得最佳的变量选择(可能是每个变量数量的最佳选择),并且您可能会获得一些统计显着性的指示。您已经违反了太多关于多重测试和独立性的规则(将 21 个观察值增加到 210 个),因此您不应该认真对待任何统计意义。如果您想知道您是在查看真实信息还是经过修饰的随机噪声,请自动化该过程并查看它在根本没有潜在影响的假数据上的样子,也许在您构建的假数据上因为你已经构建了它,所以你知道它的潜在影响的数据。另见https://en.wikipedia.org/wiki/Bootstrapping_(statistics)https://en.wikipedia.org/wiki/Resampling_(statistics)#Permutation_tests

    【讨论】:

      猜你喜欢
      • 2012-08-02
      • 2019-06-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-05-22
      • 1970-01-01
      • 1970-01-01
      • 2012-02-08
      相关资源
      最近更新 更多