【问题标题】:constructing feature vector to learn cluster构建特征向量来学习集群
【发布时间】:2013-02-23 15:40:17
【问题描述】:

例子:

文档 {
引文:{
0:引用0,
1:引用1,
2:引用2,
...
n: 引用N
}
}

我想根据引用的相似性对文档进行聚类,但是每个文档都会有很多引用。我在这里的困惑是......在这种情况下,我如何构建数据集的特征向量以将其输入我的聚类工具包。

我想让 column 成为引文,如果该文档具有该引文,则值为 1。

ps。我的机器学习背景很薄弱 - 我正在阅读我的讲义,但大多数都没有涉及这类问题>

【问题讨论】:

    标签: cluster-analysis feature-extraction


    【解决方案1】:

    构建特征向量的一种简单方法是创建邻接矩阵(例如 A)。特征是二进制的。

    每行代表被引文献,每列代表被引文献。因此,如果 Document1 仅被 Document3 引用,则元素 A(1,3)=1 并且该行的其余元素为 0。

    如果您要处理的文档太多,这可能不是有效的方法。如果您有 N 个文档,则矩阵大小为 NxN。

    如果您正在编写自己的聚类算法,请使其接受更紧凑的形式(请参阅邻接列表)。

    【讨论】:

    • 感谢您的回答。我在 weka 上阅读它们似乎具有关系属性,但我想,在正常情况下,我只会使用 NxM 矩阵,其中 M 是一长串引用。 N 是文档列表
    猜你喜欢
    • 2019-01-03
    • 1970-01-01
    • 2018-10-10
    • 2013-06-18
    • 2013-01-18
    • 2011-05-17
    • 2014-03-23
    • 2013-08-15
    • 2013-03-25
    相关资源
    最近更新 更多