【发布时间】:2016-03-14 21:17:32
【问题描述】:
我有一个包含 500 个移动设备的数据集,这些设备具有 10 个属性,即
Date|Company|ModelName|Price|HardDisk|RAM|Colour|Display size|Cam1|Cam2
示例数据集如下:
24/10/2015 | walmart | Samsung Galaxy Note 4 N910H 32GB Unlocked GSM OctaCore Cell Phone-N910H 32GB GOLD | 599.99 | 32 | N/A | cell gold | N/A | 10.2 | 16
25/10/2015 | walmart | Samsung Galaxy Note 5 SM-N920i Gold International Model Unlocked GSM Mobile Phone | 717.95 | 32 | N/A | gold | N/A | 5.7 | 16
26/10/2015 | amazon | T-Mobile AllShare Cast Wireless Hub | 65.15 | N/A | N/A | streaming | N/A | N/A | N/A
我必须通过考虑移动设备的各种属性来找到最相似或最独特的设备,或者从数据集中删除重复的移动设备。
我探索了许多相似度算法,例如 Jaccard 相似度、余弦相似度。 Levenshtein Distance,但它们似乎适用于具有相同数据类型的属性。
请考虑几乎所有属性,建议一种可以在这种类型的混合数据类型数据集上工作的算法或方法。
【问题讨论】:
标签: search similarity cosine-similarity