【发布时间】:2017-08-22 04:44:09
【问题描述】:
我有两个列表。第一个包含像
这样的条目- RB 莱比锡 vs SV 达姆施塔特 98
- 柏林赫塔 vs 霍芬海姆
- ..
在第二个中包含基本相同的条目,但可以以不同的形式编写。例如:
- 柏林赫塔 vs TSG 霍芬海姆
- RB 莱比锡 vs 达姆施塔特 98
- ..
等等。两个列表代表相同的体育比赛,但它们可以使用备用团队名称并且出现的顺序不同。
我的目标(呵呵双关语)是将两个列表统一为一个并匹配相同的条目并丢弃未出现在两个列表中的条目。
我已经尝试过使用Levensthein distance 和模糊搜索。 我想过使用机器学习,但不知道如何开始。
希望有任何帮助和想法!
【问题讨论】:
-
有助于查看列表、样本数据和所需输出的属性
-
如果您消除了所有全大写子字符串(例如 TSG、SV、RB 和 BSC),那么这两个列表的名称匹配程度如何?
-
它们可能已经是相同的,这将非常好或仍然存在很大差异,例如
M'gladbach和Monchengladbach是同一个团队,但写法不同。 -
每个列表中使用的名称是否一致,例如如果列表使用一次
M'gladbach,那么它是否总是使用M'gladbach? -
是的,一个列表的名字是一致的。
标签: c# algorithm sorting comparison fuzzy-search