【发布时间】:2017-01-10 20:54:53
【问题描述】:
我需要一些帮助,根据这些链接 link1 和 link2 中的代码编写一个程序,该程序将自动计算 a 之间的语义相似度。连续的句子和 b.在整个文档(1000 个句子)中,句子由 1 个中间短语分隔。
提供的代码已经标记化并且可以找到语义相似性,但我不知道如何编写新代码来计算(并显示)整个文本中连续和“干预”句子之间的语义相似性(a,b) .我不想一遍又一遍地做同样的事情。
【问题讨论】:
-
您好,这些文章主要是我理解的理论,我无法将这些想法应用到代码中并自动化流程。
-
到目前为止你尝试过什么?我想你会有某种程序逐行读取文件并将它们与下一行/相邻短语进行比较?
-
嗨,我找到了这个link,我认为它可以完成连续句子的任务(如果我错了并且误解了代码,请纠正我)。如果不是,您将如何为非连续短语更改此代码?
-
你提供的最后一个链接中的相似度函数可以让你比较句子之间的语义相似度,你必须有一个循环遍历你想要比较的句子的 feeder 程序。
标签: python vector tf-idf sentence-similarity latent-semantic-analysis