【发布时间】:2018-04-14 02:22:03
【问题描述】:
我正在尝试实现一个自然语言查询预处理模块,该模块将在给定以自然语言制定的查询的情况下,从该查询中提取关键字并将其提交给信息检索 (IR) 系统。
起初,我考虑使用一些训练集来计算术语的 tf-idf 值,并使用这些值来估计单个单词的重要性。但再想一想,这在这种情况下没有任何意义——我只有一个训练集合,但我无权访问 IR 数据的索引。仅使用 idf 值进行此类估计是否合理?或者也许是另一种加权方法?
您能建议如何解决这个问题吗?通常,我阅读的有关 NLP 处理的文章都针对训练和测试数据集。但是如果我只有查询和训练数据呢?
【问题讨论】:
-
“关键字”和“提交到 IR 系统”到底是什么意思?
-
有一个信息检索系统(如谷歌),给定一个查询返回结果...我想从用自然语言编写的查询中提取最重要的词并将这些词用作新的查询此检索系统以获得更好的结果...