【发布时间】:2014-12-23 12:55:39
【问题描述】:
如何使用给定的查询“20”来实现这一点,内容为“something 20”的文档具有类似MAX_SCORE 的内容,而其他文档例如“something 20/12”有普通的吗?
我正在使用压倒一切的相似性算法来简化搜索,但这种行为现在很痛苦。我需要将 lengthNorm 因子设置为“1”,因为我不想让“更短的文档会有更大的分数”行为(没有这个“20”显然会赢,但不是因为它完全适合,而是因为它更短......)。
我的自定义相似度类目前看起来像这样
public class SimpleSimilarity extends DefaultSimilarity {
public SimpleSimilarity(){}
@Override
public float idf(long docFreq, long numDocs) { return 1f; }
@Override
public float tf(float freq) { return 1f; }
@Override
public float lengthNorm(FieldInvertState state) {
return 1f;
}
}
【问题讨论】:
-
this 的重复?
-
有点不同。我编辑了问题 - 文档的内容。如果它不会被标记化等等,当我查询“20”时,“something 20”和“something 20/12”可能不会得到任何分数