【发布时间】:2017-12-11 12:42:34
【问题描述】:
我正在努力寻找短句和文章之间的相似之处。我使用了许多现有的方法,例如 tf-idf、word2vec 等,但结果还可以。我发现最相关的度量是词移动距离,但是,它的结果并不比其他度量好。我知道这是一个具有挑战性的问题,但是,我想知道是否有任何新方法可以在更高或概念级别上找到近似相似性,而不仅仅是匹配单词。特别是,是否有任何替代的新方法,例如单词移动距离,它着眼于句子或文章的语义略高?
【问题讨论】:
-
恐怕您的问题不适合 SO。如果您正在寻求其他现有工具的指导,这被认为是题外话。如果您想看到人们发明新方法,您需要为研究项目筹集资金。
-
顺便说一句,使用词嵌入不仅仅是“匹配词”。它应该在更高的语义级别上工作。
-
@lenz 我并不是要在这里寻找新的方法,而是要问我是否错过了一些已经存在的东西。也许从 2017 年开始。
-
人们期望“嵌入”表现良好,但至少在实践中,它并没有大大超过简单的单词匹配。
标签: machine-learning nlp artificial-intelligence nltk similarity