【发布时间】:2014-03-20 00:02:52
【问题描述】:
我开发了一种新的文档相似度度量(一种计算两个文档之间的相似度/距离的方法)。我要知道这个措施有多好?
聚类是一种基于距离/相似度度量的应用程序。因此,我决定在不同的数据聚类算法中评估所提出的度量的有效性。
我读到了different clustering algorithms in R。假设我有一个文档集合 D,其中包含 n 个文档,以 k 个集群组织。我想评估我的相似度/距离度量在各种聚类算法(分区、分层和基于主题)中的应用。问题是所有示例和教程都从“数据”矩阵开始,但我有一个距离/相似度矩阵。
你能帮我一些关于 R 的提示吗?
【问题讨论】:
-
是这样吗?在您的链接之后,在 Hierarchical Agglomerative 下进行分析,例如从(构建)距离矩阵开始。
标签: r cluster-analysis similarity k-means hierarchical-clustering