【发布时间】:2022-01-10 16:27:55
【问题描述】:
我为语料库中的所有文档创建了一个histogram with the similarity scores。分数是用 TF-IDF/余弦相似度计算的。请参阅包含的图像。我不是 100% 确定如何阅读图表。分数的紧凑性是否表明语料库以好的方式密切相关或以不好的方式密切相关?还是我完全看错了?
tf = TfidfVectorizer(analyzer='word', ngram_range=(1, 2), min_df=5)
tfidf_matrix = tf.fit_transform(ds['clean_text'])
cosine_similarities = linear_kernel(tfidf_matrix, tfidf_matrix)
【问题讨论】:
-
1) 没有图片链接。 2)你想从情节中学习/评估什么?
-
我想我需要显示链接的描述。我试图大致了解结果与语料库的关系有多准确。我假设因为相似度得分在 0.6 左右达到峰值并且压缩得很好,所以结果相当不错。
标签: machine-learning unsupervised-learning