【发布时间】:2013-02-23 15:40:17
【问题描述】:
例子:
文档 {
引文:{
0:引用0,
1:引用1,
2:引用2,
...
n: 引用N
}
}
我想根据引用的相似性对文档进行聚类,但是每个文档都会有很多引用。我在这里的困惑是......在这种情况下,我如何构建数据集的特征向量以将其输入我的聚类工具包。
我想让 column 成为引文,如果该文档具有该引文,则值为 1。
ps。我的机器学习背景很薄弱 - 我正在阅读我的讲义,但大多数都没有涉及这类问题>
【问题讨论】:
标签: cluster-analysis feature-extraction