【发布时间】:2016-03-29 19:49:03
【问题描述】:
我对数据挖掘、数据分析或统计分析一无所知,但我认为我需要的是找到“矩阵中的集群”。我有一个约 2 万条记录的数据集,每条记录都有约 40 个特征,所有这些特征要么打开要么关闭。
+--------+------+------+------+------+------+------+
| record | hasA | hasB | hasC | hasD | hasE | hasF |
+--------+------+------+------+------+------+------+
| foo | 1 | 0 | 1 | 0 | 0 | 0 |
| bar | 1 | 1 | 0 | 0 | 1 | 1 |
| baz | 1 | 1 | 1 | 0 | 0 | 0 |
+--------+------+------+------+------+------+------+
我非常相信这 20k 条记录中的大多数都具有属于几个类别之一的特征。必须有办法确定记录“foo”与记录“bar”的相似程度。
那么,我实际上在看什么?我在寻找什么算法?
【问题讨论】:
-
所有特征都是 0/1 值吗?
-
这对Cross Validated来说可能是一个更好的问题。
-
@blazs 是的,“打开或关闭”我的意思是 1/0,抱歉。正如您在答案的第一句话中所想的那样。
标签: machine-learning cluster-analysis data-analysis