【发布时间】:2014-04-19 15:56:22
【问题描述】:
我正在尝试识别数据库中几乎重复的名称条目。我是数据库新手,但我熟悉 R。我可以使用 R 中的模糊匹配和 soundex 来获得近乎重复的集群。但是有几个名称是彼此的同义词。我想将基于此标准的名称与上述标准进行聚类。
我想按照Techniques for finding near duplicate records 中的建议进行操作,但使用同义词。我知道有一种称为 WordNet 的英语单词同义词数据库,其中包含称为 synsets 的同义词集。但是字段名称中的条目有不同的格式和语言。
例如如果知道“R version 3.0.3”和“Warm Puppy”是同义词。我希望能够使用这样的自定义同义词 syn1
在路上,我还想根据记录的其他字段(列)中的条目将同音词分开。
有什么方法可以在 R 中实现吗?
【问题讨论】:
标签: r duplicate-removal synonym duplicates