【发布时间】:2020-04-19 20:50:56
【问题描述】:
对两个短文本语料库之间的语义相似度进行无监督比较的正确方法是什么?比较两者的 LDA 主题分布似乎不是一个解决方案,因为对于短文档,生成的主题并不能很好地掌握语义。分块没有帮助,因为跟随的推文不必是同一主题。是例如在这些语料库中创建文档 TF-IDF 之间的余弦相似度矩阵是一种好方法吗?
【问题讨论】:
-
比较的«单位»是什么?句子?段落?文章?完整的文件?
-
最终,语料库。至于对他们的分数有贡献的子单位,我不确定。直觉上,我会在文档中寻找关键字。不过,我不知道这在多大程度上是个好主意。
-
这是一个非常广泛的课题,完全没有解决的研究课题。您可以研究嵌入或词频矩阵,或者仅使用文档词矩阵计算距离......如果没有直觉(基于您的数据和预期的高/低分),很难提供帮助。
标签: nlp information-retrieval corpus