【发布时间】:2010-10-18 10:34:32
【问题描述】:
假设您有一个包含 varchar 列的大表。
您将如何匹配在 varchar col 中包含“首选”一词但数据有些嘈杂且偶尔包含拼写错误的行,例如:
['$2.10 Cumulative Convertible Preffered Stock, $25 par value',
'5.95% Preferres Stock',
'Class A Preffered',
'Series A Peferred Shares',
'Series A Perferred Shares',
'Series A Prefered Stock',
'Series A Preffered Stock',
'Perfered',
'Preffered C']
上述拼写错误中“首选”一词的排列似乎显示为family resemblance,但它们几乎没有共同点。请注意,拆分每个单词并在每一行的每个单词上运行 levenshtein 会非常昂贵。
更新:
还有其他几个类似的例子,例如带有“受限”:
['Resticted Stock Plan',
'resticted securities',
'Ristricted Common Stock',
'Common stock (restrticted, subject to vesting)',
'Common Stock (Retricted)',
'Restircted Stock Award',
'Restriced Common Stock',]
【问题讨论】:
-
您是专门询问“首选”,还是这是一个普遍问题?
-
还有少量其他类似的例子