【问题标题】:Can I keep new words in dictionary by matching key as prefix我可以通过匹配键作为前缀在字典中保留新单词吗
【发布时间】:2018-05-14 21:36:13
【问题描述】:

我有一本字典,

stringToListDict = {'foo' : [], 'bar' : []}

现在假设我们这样做了

+foofoo

stringToListDict = {'foo' : ['foofoo'], 'bar' : []}

+条形条

stringToListDict = {'foo' : ['foofoo'], 'bar' : ['barbar']}

+foobarbar

stringToListDict = {'foo' : ['foofoo', 'foobarbar'], 'bar' : ['barbar']}

+notMatchingAnyKey

Simply discard this new string.

如您所见,添加的字符串通过匹配键作为前缀进行。

我可以通过一个一个地遍历字典中的每个键来做到这一点,直到我得到一个匹配的前缀。但是还有其他优雅或有效的方法吗?您不必担心边缘情况,例如:

stringToListDict = {'foo' : ['foofoo'], 'foobar' : [], 'bar' : ['barbar']}

then +foobarbar

仅供参考,这不是作业。

【问题讨论】:

  • 等等,匹配条件是什么?前 3 个字母?
  • 完整的密钥必须匹配。任何一位。在我的场景中没有发生碰撞的情况,所以不必担心 foo 和 foobar 键。键和输入字符串可以是任意长度。
  • 对不起,你让我感到困惑。 +foofoo 在代码中是什么意思?你能给我们看看吗?
  • +foofoo 表示您正在尝试将此字符串放在字典下的最佳匹配键中。就像在以“An”为前缀的页面上一样,您应该会看到以“An”开头的“Ant”、“And”、“Analog”等词。
  • 如果您使用的是字典,那么是的,这里唯一的选择是迭代所有键,例如for k, v in d.items(): if s.startswith(k): v.append(s)。不同的数据结构,如搜索树或树,可以使这更有效(对数时间而不是线性时间),尽管它不会更简单(因为字典已经很简单了使用)。

标签: python algorithm dictionary optimization


【解决方案1】:

如果您使用的是 dict,那么是的,您必须遍历所有键才能找到任何匹配项。字典是建立在哈希表上的,哈希函数没有任何“开始于”或“关闭”的概念可以利用(事实上,它们专门设计用于为关闭输入提供非常不同的输出)。

做你想做的事一点都不难:

for k, v in d.items():
    if s.startswith(k):
        v.append(s)
        break
else:
    # whatever you want to do if no prefix exists

但是如果字典很大,它效率很低,因为你正在做一个线性搜索。


您可以使其与键的长度成线性关系,而不是 dict 的长度(在您的测试用例中实际上会更慢,但在大多数性能很重要的情况下可能会更快):

for i in range(len(s), 0, -1):
    try:
        d[k[:i]].append(s)
        break
    except KeyError:
        pass
else:
    # whatever you want to do if no prefix exists

但是,如果您需要最佳效率,则需要查看对数数据结构,例如平衡二叉搜索树、b-tree、skiplist、trie,甚至只是按排序顺序保存的普通旧列表。您可以在 PyPI 或 ActiveState 配方存储库上找到的大多数此类类型的实现都将具有一种按排序顺序查找键的插入位置的方法。或者,如果您使用的是普通的旧列表,只需使用 stdlib 中的 bisect 模块。只需检查该插入位置之前的密钥,它要么以您的密钥开头,要么什么都不做。

例如,sortedcontainers.SortedDict:

i = d.bisect(s)
if d.iloc[i].startswith(s):
    d[d.iloc[i]].append(s)
else:
    # whatever you want to do if no prefix exists

如果您有大量密集的键并且您正在执行大量查询和插入操作,那么前缀树可能是最有效的。但是对于不同的特征,其他人可能会胜出。因此,如果这很重要,您可以尝试一些并进行测试。

【讨论】:

    【解决方案2】:

    您可以使用如下函数执行前缀匹配:

    代码:

    def append_longest_prefix(data_dict, to_append):
        for i in range(1, len(to_append)):
            if to_append[:-i] in data_dict:
                data_dict[to_append[:-i]].append(to_append)
                return
    

    测试代码:

    data = {'foo': [], 'bar': []}
    
    append_longest_prefix(data, 'foofoo')
    append_longest_prefix(data, 'barbar')
    append_longest_prefix(data, 'foobarbar')
    append_longest_prefix(data, 'notMatchingAnyKey')
    
    print(data)
    
    data = {'foo' : ['foofoo'], 'foobar' : [], 'bar' : ['barbar']}
    append_longest_prefix(data, 'foobarbar')
    print(data)
    

    结果:

    {'foo': ['foofoo', 'foobarbar'], 'bar': ['barbar']}
    
    {'foo': ['foofoo'], 'foobar': ['foobarbar'], 'bar': ['barbar']}
    

    【讨论】:

    • 你的代码会处理问题末尾提到的边缘情况吗?
    • 哪种边缘情况?
    • stringToListDict = {'foo' : ['foofoo'], 'foobar' : [], 'bar' : ['barbar']} 然后 +foobarbar
    • 是的,它匹配最长的前缀。
    【解决方案3】:

    你可以试试:

    _dict = {'foo' : [], 'bar' : []}
    
    def _add(_str):
        for _key in _dict.keys(): # loop _dict keys
            if _str.startswith(_key): # check if _str starts with _dict _key
                _dict[_key].append(_str) # append _str to _dict based on _key
    
    _add("foofoo")
    _add("barbar")
    _add("foobarbar")
    _add("notMatchingAnyKey")
    
    # {'foo': ['foofoo', 'foobarbar'], 'bar': ['barbar']}
    

    Ideone Demo

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2012-02-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多