【发布时间】:2021-10-07 07:09:20
【问题描述】:
我最近一直在了解不同的字符串搜索算法,例如 Knuth-Morris-Pratt 和 Boyer Moore 算法,在此过程中,我了解了这两种算法的一些细节我无法消化或对这些内容形成了自己的理解,但仍不确定它们的正确性。
问题:
- question 的最高答案指出,如果字母表很小,KMP 效果很好。为什么会出现这种情况,为什么 Boyer 的算法在这种情况下不能比 KMP 表现更好?
- KMP 和 Boyer 算法性能最差的每个示例是什么? 我已经发现,对于像这样的例子 Boyer 会给出最差的性能。对吗?
text='AAAAA....13 A'S'
pattern='AAA'
3.我能够理解 KMP 的正确前缀方面,并且还能够消化这样一个事实,即它在跳过文本中已经匹配的部分时不会跳过可能的匹配项,但即使我确实得到了背后的直觉Bad Character Heuristic 和 Good Suffix Heuristic 的 Boyer 算法专注于跳过字符,以便模式与未来可能的匹配一致,我仍然无法让自己理解这两种启发式方法如何保证跳过的字符不会匹配无论如何。
给定document 中第二页的第 4 段谈到了相同的内容,即我们可以跳过文本中的某些字符而无需查看它们。为什么我们可以忽略它们?
- 用 Layman 的语言,我们可以说 KMP 和 Boyer 算法之间的区别在于 KMP 通过跳过已经匹配的字符来工作,而 Boyer 通过跳过不会产生任何区别的字符来工作,因为文本上窗口的当前位置已经有了错过比赛。
【问题讨论】:
标签: algorithm string-matching knuth-morris-pratt boyer-moore