【发布时间】:2015-03-31 16:01:50
【问题描述】:
我在 SAS 工作,我有一个包含 2 列的数据集,我不仅想删除重复项,还想删除“几乎”重复项。数据如下所示:
**Brand Product**
Coca Cola Coca Cola Light
Coca Cola Coca Cola Lgt
Coca Cola Cocacolalight
Coca Cola Coca Cola Vanila
Pepsi Pepsi Zero
Pepsi Pepsi Zro
我不知道这是否真的可能,但我希望文件在删除“重复项”后看起来像这样:
**Brand Product**
Coca Cola Coca Cola Light
Coca Cola Coca Cola Vanila
Pepsi Pepsi Zero
如果决赛桌有例如,我没有偏好。 “Pepsi Zero”或“Pepsi Zro”,只要没有“重复”值即可。
我在想是否有办法比较例如前 4-5 个字母,如果它们相同,则将它们视为重复。但我当然愿意接受建议。如果有办法在 excel 中完成,我很想听听。
【问题讨论】:
-
注:这种过程涉及到一个完整的领域,而且很难有效地进行。