【发布时间】:2019-04-07 20:16:19
【问题描述】:
我正在构建一个机器人来监控我感兴趣的主题的 HN。
我想分析一个内存中的字符串,并确定它是否包含一些我感兴趣的关键字。
我希望它考虑到 Lucene 在执行标准查询时所做的事情(词干、停用词、标准化标点符号等)。
我可能会构建一个内存索引,并使用常规方法对其进行查询,但是有没有一种方法可以使用 Lucene 的内部结构来避免构建不必要的索引?
如果我能得到一个相关性值 (0.0-1.0),而不仅仅是一个真/假值,那么奖励积分。
伪代码:
public static decimal IsRelevant(string keywords, string input)
{
// Does the "input" variable look like it contains "keywords"?
}
IsRelevant("books", "I just bought a book, and I like it."); // matching!
IsRelevant("book", "I just bought many books!"); // matching!
【问题讨论】: