【发布时间】:2017-11-08 09:00:11
【问题描述】:
我正在开展一个项目,该项目要求我将短语或关键字与一组相似的关键字进行匹配。我需要为此执行语义分析。
一个例子:
相关QT
便宜的健康保险
负担得起的健康保险
低成本医疗保险
少花钱的健康计划
便宜的医疗保险
共同意义
低成本健康保险
这里 Common Meaning 列下的单词应该与 Relevant QT 列下的单词匹配。我查看了一堆工具和技术来做同样的事情。 S-Match 看起来很有前途,但我必须使用 Python,而不是 Java。潜在语义分析也看起来不错,但我认为它更多地用于基于关键字而不是关键字匹配的文档分类。我对 NLTK 有点熟悉。有人可以提供一些关于我应该朝着什么方向前进以及我应该使用什么工具的见解吗?
【问题讨论】:
-
你的项目范围是什么?如果您正在处理一些核心关键词或意义,手动指定单词等价类可能很容易(例如,表示“低成本健康保险”的短语单词列表)。
-
我必须从大约 200000 个单词中提取语义相似的单词,例如低成本健康保险。我想我必须在对这些单词运行初始算法后应用聚类以生成某种中心(单词),这些中心(单词)将匹配其集群中语义相似的单词。整个过程无人监督。
标签: python nlp nltk latent-semantic-indexing