【发布时间】:2016-08-30 01:26:11
【问题描述】:
我有一个 1830*6800 的矩阵,如下所示:
1830行是不同的创业公司ID,列是6800个不同的投资人。现在我想找出那些成功筹集到足够资金的公司和那些没有那么幸运获得足够资金的公司之间的相似之处。
我正在考虑使用 k-means 聚类和谱聚类,将聚类数设置为 2 以拥有 2 个不同的组(即成功和失败)。但是 k-means 给了我几乎所有的 0,这意味着所有行都在同一个簇中。
谁能给我一些想法,如何选择更适合这种情况的算法?它不一定是集群。
【问题讨论】:
-
单元格中的值是什么?
-
值是 1 或 0。 1 代表成功从其中一位投资者那里获得资金,0 代表失败。
-
你的数据有多稀疏?如果你总结你的总数据框,你会得到什么?
-
所以实际上原始矩阵是 1830 * 140000000,我运行随机投影以降维到 1830*6800。原始矩阵非常稀疏,因为大多数行只能有 10-1000 个投资者,而总共有 140000000 个投资者
标签: algorithm machine-learning cluster-analysis gaussian