【发布时间】:2016-12-22 23:25:53
【问题描述】:
我有一组来自 NCAA 的球队名称,以及与之相关的统计数据。学校名称通常会缩短或完全省略,但名称的所有变体通常都有一个共同的元素(例如 Alabama Crimson Tide vs Crimson Tide)。这些名称都包含在一个数组中,没有特定的顺序。我希望能够通过模糊匹配来获取团队名称的所有变体并将所有变体重命名为一个名称。我在 python 2.7 中工作,我有一个包含所有数据的 numpy 数组。任何帮助将不胜感激,因为我以前从未使用过模糊匹配。
我考虑过通过 for 循环进行模糊匹配,它会(尽管速度慢得令人难以置信)将数组列中的每个元素与其他每个元素进行比较,但我不确定如何构建它。
目前,我的数组如下所示:
{姓名 , info1, info2, info 3}
数组有几千行长,所以我试图让程序尽可能高效。
【问题讨论】:
-
在内存中的数组上运行的 for 循环中,几千行应该很快。
-
在我最后一次尝试这样做时,它从未完成。我确实同意它不应该永远持续下去,所以我一定做错了什么。我只是不确定如何解决这个循环。
标签: python-2.7 fuzzy-comparison