【发布时间】:2015-12-02 06:39:59
【问题描述】:
我正在用 python 创建一个非常基本的搜索引擎,我正在创建一种处理短语查询的方法,所以如果 2 个单词的位置在 1 以内,它们在文档中彼此相邻,它将输出发生这种情况的所有文档编号。
我目前有一本像这样的字典
{'8':[['1170', '1264', '1307', '1559', '1638'], ['197', '1169']],
'6':[['345', '772'], ['346']}
这只是一个布局示例。
w=word, p=position ||
{doc1:[w1p1, w1p2, w1p3],[w2p1, w2p2]}
key 是文档 id,然后是文档中第一个单词包含的位置,然后是第二个单词的位置。将有与查询中的一样多的单词(位置分组)。
我的问题是,有没有一种方法可以比较相同文档 ID 的 1 和 2nd + 3rd 等的值?我想比较它们,看看一个词的位置是否只是另一个词的+1。
所以你可以看到 doc 6 单词 2 跟在单词 1 之后,这将导致密钥被发回。
【问题讨论】:
标签: python dictionary