【问题标题】:Identifying near duplicate entries using synonyms in R使用 R 中的同义词识别近乎重复的条目
【发布时间】:2014-04-19 15:56:22
【问题描述】:

我正在尝试识别数据库中几乎重复的名称条目。我是数据库新手,但我熟悉 R。我可以使用 R 中的模糊匹配和 soundex 来获得近乎重复的集群。但是有几个名称是彼此的同义词。我想将基于此标准的名称与上述标准进行聚类。

我想按照Techniques for finding near duplicate records 中的建议进行操作,但使用同义词。我知道有一种称为 WordNet 的英语单词同义词数据库,其中包含称为 synsets 的同义词集。但是字段名称中的条目有不同的格式和语言。

例如如果知道“R version 3.0.3”和“Warm Puppy”是同义词。我希望能够使用这样的自定义同义词 syn1

在路上,我还想根据记录的其他字段(列)中的条目将同音词分开。

有什么方法可以在 R 中实现吗?

【问题讨论】:

    标签: r duplicate-removal synonym duplicates


    【解决方案1】:

    作物,这不是一个答案,但可能会对你或其他回答的人有所帮助。

    我假设您知道,TM 包允许自定义停用词,但我无法回忆起您的 Warm Puppy 示例中的自定义同义词向量。这将非常有用。

    其次,Tyler Rinker 的 qdap 包具有很多功能,并且可能具有(或他可能创建)这样的同义词功能。

    第三,RTextTools 包合并了许多包和功能。它背后的团队可能会有所帮助。

    对于我所做的事情来说,拥有同义词向量功能会非常有用。祝你好运,我会回来查看的。

    【讨论】:

    • 是的@user2583119 这不是一个答案,但我认为你已经将讨论推向了正确的方向。 qdap 包有一个同义词搜索功能 syn,它使用内置字典“SYNONYMN”。如果可以将自定义字典用作数据框,那么我们可以尝试获得所需的同义词聚类。
    • 感谢 Tyler Rinkler,现在 qdap 中有一个用户定义的同义词查找选项。我会尝试使用它。
    猜你喜欢
    • 1970-01-01
    • 2017-07-13
    • 1970-01-01
    • 1970-01-01
    • 2012-06-04
    • 2017-04-10
    • 2017-04-14
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多