【发布时间】:2015-06-12 06:13:56
【问题描述】:
我遇到了匹配两个字符串“更一般”、“不太一般”、“相同含义”、“相反含义”等的问题。
字符串可以来自任何域。假设字符串可以来自人们的电子邮件。
举个例子,
String 1 = "movies"
String 2 = "Inception"
在这里我应该知道,《盗梦空间》不如电影一般(有点像是一种关系)
String 1 = "Inception"
String 2 = "Christopher Nolan"
这里我应该知道,盗梦空间不如克里斯托弗诺兰通用
String 1 = "service tax"
String 2 = "service tax 2015"
乍一看,我觉得 S-match 可以胜任。但我不确定 S-match 是否可以用于 WordNet 或 GeoWordNet 以外的知识库(如他们的页面中所述)。
如果我使用word2vec 或dl4j,我想它可以给我相似度分数。但是它是否也支持告诉一个字符串是more general或less general而不是另一个?
但我确实看到 word2vec 可以基于训练集或维基百科等大型语料库。
有人可以在前进的路上照亮吗?
【问题讨论】:
标签: semantic-analysis word2vec