【问题标题】:R data clustering using a pre-defined distance/similarity matrix使用预定义的距离/相似度矩阵的 R 数据聚类
【发布时间】:2014-03-20 00:02:52
【问题描述】:

我开发了一种新的文档相似度度量(一种计算两个文档之间的相似度/距离的方法)。我要知道这个措施有多好?

聚类是一种基于距离/相似度度量的应用程序。因此,我决定在不同的数据聚类算法中评估所提出的度量的有效性。

我读到了different clustering algorithms in R。假设我有一个文档集合 D,其中包含 n 个文档,以 k 个集群组织。我想评估我的相似度/距离度量在各种聚类算法(分区、分层和基于主题)中的应用。问题是所有示例和教程都从“数据”矩阵开始,但我有一个距离/相似度矩阵。

你能帮我一些关于 R 的提示吗?

【问题讨论】:

  • 是这样吗?在您的链接之后,在 Hierarchical Agglomerative 下进行分析,例如从(构建)距离矩阵开始。

标签: r cluster-analysis similarity k-means hierarchical-clustering


【解决方案1】:

hclust() 需要一个相异结构,即dist 对象。如果您从数字矩阵m 开始,您可以像这样创建dist 对象:

d <- as.dist(m)

然后您可以使用hclust() 执行层次聚类,如下所示:

hclust(d)

【讨论】:

    猜你喜欢
    • 2021-09-28
    • 2023-03-07
    • 2019-02-05
    • 2014-07-28
    • 2016-08-21
    • 2011-04-13
    • 2015-07-17
    • 2015-09-14
    • 2016-03-20
    相关资源
    最近更新 更多