【发布时间】:2013-10-24 23:19:45
【问题描述】:
我有分类文本的语料库。从这些我创建向量。每个向量对应一个文档。向量分量是本文档中的单词权重,计算为 TFIDF 值。接下来,我构建了一个模型,其中每个类都由一个向量表示。模型具有与语料库中的类一样多的向量。模型向量的分量被计算为取自此类向量的所有分量值的平均值。对于未分类的向量,我通过计算这些向量之间的余弦来确定与模型向量的相似性。
问题:
1) 我可以使用未分类向量和模型向量之间的欧几里得距离来计算它们的相似度吗?
2) 为什么欧几里得距离不能作为相似度度量,而不是两个向量之间夹角的余弦值,反之亦然?
谢谢!
【问题讨论】:
-
这个问题似乎是题外话,因为它是关于统计,而不是编程。试试stats.stackexchange.com。
标签: vector distance euclidean-distance trigonometry