【发布时间】:2016-01-19 11:29:44
【问题描述】:
这可能是一个相当基本的 NLP 问题,但我手头有以下任务:我有一组文本文档,我需要根据可能是 1-、2-、3 的(英语)术语词典对这些文档进行评分- 等N-字长。 N 受一些“合理”数字的限制,但字典中各种术语的分布对于 n = 1, ..., N 的各种值可能是相当均匀的。例如,此词典可以包含特定类型的设备列表,我想查看给定文档是否可能与这些设备中的任何一个有关。因此,如果文档中的任何词典条目出现一次或多次,我想给它打高分。
在考虑词典中可能出现的各种形式的单词的同时进行评分的标准 NLP 技术是什么?输入文档和词典都需要什么样的预处理才能执行评分?有哪些用于预处理和评分的开源工具?
【问题讨论】:
-
您可能想要搜索术语“词形还原”——在一个标题(词根或词根)下组合单词的多种形式。如果您扫描machine-learning 标签,您会发现很多工具参考:MLlib、SciKit Learn、SCLearn 等。开源中一个相当新的工具是 Trusted Analytics Platform(我在软件团队中)。
标签: nlp matching n-gram scoring lexicon