【问题标题】:TF-IDF/Cosine Similarity - Similarity HistogramTF-IDF/余弦相似度 - 相似度直方图
【发布时间】:2022-01-10 16:27:55
【问题描述】:

我为语料库中的所有文档创建了一个histogram with the similarity scores。分数是用 TF-IDF/余弦相似度计算的。请参阅包含的图像。我不是 100% 确定如何阅读图表。分数的紧凑性是否表明语料库以好的方式密切相关或以不好的方式密切相关?还是我完全看错了?

tf = TfidfVectorizer(analyzer='word', ngram_range=(1, 2), min_df=5)
tfidf_matrix = tf.fit_transform(ds['clean_text'])
cosine_similarities = linear_kernel(tfidf_matrix, tfidf_matrix)

【问题讨论】:

  • 1) 没有图片链接。 2)你想从情节中学习/评估什么?
  • 我想我需要显示链接的描述。我试图大致了解结果与语料库的关系有多准确。我假设因为相似度得分在 0.6 左右达到峰值并且压缩得很好,所以结果相当不错。

标签: machine-learning unsupervised-learning


【解决方案1】:

查看直方图,似乎文档相似度不是那么集中(余弦相似度有界 [0,1],您的直方图范围约为 0.2-1)。这是好是坏取决于你对数据的期望,以及你以后想用 TF-IDF 矩阵做什么。如果你有一个多样化的语料库(例如维基百科),那么你会期望范围很广,如果你的余弦相似度分数范围很窄,你会怀疑。但是,如果您的语料库源自一组高度相似的文档(例如,某班学生的读书报告)。

一般来说,您的相似度分数的分布更多的是仅供参考,而不是数据集质量的衡量标准。

【讨论】:

  • 语料库是(多样化的)新闻稿数据,因此 0.2 到 1 的范围与我预期的差不多。直方图峰值在 0.6 到 0.7 范围内,我认为这是有希望的,而且我所做的样本测试对于一般推荐引擎来说看起来不错。在查看直方图时,您还能提供什么其他建议?
猜你喜欢
  • 1970-01-01
  • 2012-11-20
  • 2017-02-03
  • 2013-02-03
  • 2013-10-16
  • 1970-01-01
  • 2010-12-31
  • 1970-01-01
  • 2020-02-20
相关资源
最近更新 更多