【发布时间】:2017-02-25 23:27:27
【问题描述】:
我有一个包含城市名称和犯罪计数的数据集。数据很脏,例如“纽约”之类的城市名称写为“纽约”、“纽约我们”、“纽约市”、“曼哈顿纽约”等。我如何对所有这些进行分组城市一起总结他们的罪行?
我尝试了 python 中的“difflib”包,它匹配字符串并给你一个分数。效果不好。我还尝试了 python 中的地理编码包。它对您可以访问 api 的次数有限制,并且也不能很好地工作。有什么建议?
【问题讨论】:
-
那么,如果数据脏了,你也不能确定“new york”写对了,也就是说它也可以拼写“nwe yrok”之类的?
-
this 是什么东西?