【问题标题】:Edit-based distance(matching) with custom character substitution distance具有自定义字符替换距离的基于编辑的距离(匹配)
【发布时间】:2021-11-08 02:32:36
【问题描述】:

我想将一个字符串与 OCR(光学字符识别)中的另一个字符串进行匹配。

通常,OCR 读取的文本是不完美的。在我的情况下,5 被误识别为 S 等等。

所以我想知道是否有办法用自定义距离计算编辑距离。

例如,如果我想计算从5S00ASSSOODS 的距离,

我想让AD 的替换距离大,5S 小,这样distance('5S00AS', 'SSOOAS') 就比distance('5S00AS', 'PDDDDA') 小很多。

我认为 soundex 是相似的,除了相似的声音有更小的距离。对于看起来相似的拼写,我们应该有更小的距离。

我想知道是否已经有一个函数或包可以进行这种类型的距离计算。

【问题讨论】:

    标签: python r edit-distance


    【解决方案1】:

    您正在寻找具有自定义分数的 Levenshtein 距离。看更一般的https://en.wikipedia.org/wiki/Needleman–Wunsch_algorithm

    nltk lib levenshein 实现不支持使用自定义分数,但在 needleman-wunsch 实现中,您通常可以指定这一点(很容易修改算法以使用自定义距离矩阵)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-07-15
      • 2018-09-21
      • 1970-01-01
      • 2021-08-01
      相关资源
      最近更新 更多