【问题标题】:Find similar items in a dataset在数据集中查找相似项目
【发布时间】:2016-03-14 21:17:32
【问题描述】:

我有一个包含 500 个移动设备的数据集,这些设备具有 10 个属性,即

Date|Company|ModelName|Price|HardDisk|RAM|Colour|Display size|Cam1|Cam2

示例数据集如下:

24/10/2015   |   walmart   |  Samsung Galaxy Note 4 N910H 32GB Unlocked GSM OctaCore Cell Phone-N910H 32GB GOLD   |   599.99  |   32   |  N/A   |  cell gold             |  N/A   | 10.2 | 16   
25/10/2015  |  walmart  |  Samsung Galaxy Note 5  SM-N920i Gold International Model Unlocked GSM Mobile Phone    |  717.95  |  32   |   N/A   |  gold  |    N/A   |  5.7    |   16  
26/10/2015  |  amazon  |   T-Mobile AllShare Cast Wireless Hub   |   65.15  |   N/A |  N/A  |  streaming    |   N/A  |  N/A   |  N/A

我必须通过考虑移动设备的各种属性来找到最相似或最独特的设备,或者从数据集中删除重复的移动设备。

我探索了许多相似度算法,例如 Jaccard 相似度、余弦相似度。 Levenshtein Distance,但它们似乎适用于具有相同数据类型的属性。

请考虑几乎所有属性,建议一种可以在这种类型的混合数据类型数据集上工作的算法或方法。

【问题讨论】:

    标签: search similarity cosine-similarity


    【解决方案1】:

    您可以计算每一行的哈希码。

    然后使用哈希码的差异作为相似性度量。

    显然,这取决于所有属性。

    非常适合查找重复项

    这可能对您的应用程序不利 - 但您没有指定对您的应用程序有什么好处。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2019-01-03
      • 2013-02-23
      • 1970-01-01
      • 2011-04-19
      • 2016-09-01
      • 2015-06-16
      • 1970-01-01
      相关资源
      最近更新 更多