【发布时间】:2016-09-25 22:08:19
【问题描述】:
假设我在网站上有一个条目 pepe jeans。用户搜索pepejeans。我目前正在使用 tf-idf 和余弦相似度来返回最显着的结果,但由于内容很大,我将内存使用量保持在尽可能小。那么我可以用什么来解决这个问题呢?一种解决方案是对内容的所有 ngram 进行带空格和不带空格的记录。
另一个例子- 如果用户搜索耐克鞋。现在耐克是一个品牌,但耐克鞋不是一个品牌。如果搜索查询是耐克鞋,那么它会返回耐克作为品牌。 这里的内容是指品牌名称。我正在尝试从查询中识别品牌名称
【问题讨论】:
标签: java search nlp search-engine tf-idf