【发布时间】:2021-04-24 13:31:21
【问题描述】:
我有一个包含 28000 条记录的数据集。该数据是电子商务商店菜单项的数据。挑战如下:
多家商店的产品相似,但名称不同。例如,“HP 笔记本电脑 1102”以“HP 笔记本电脑 1102”、“Hewlett-Packard 笔记本电脑 1102”、“HP 笔记本电脑 1102”和许多其他不同的名称出现在不同的商店中。
我选择将产品列表转换为 tfidf 向量,并使用 KMeans 聚类将相似的产品组合在一起。我还使用了一些其他功能,如产品类别、子类别等。(我有一个热编码所有类别特征)
现在我的挑战是估计 KMeans 算法中的最优 n_clusters。由于集群应该发生在产品级别,我假设我需要一个高 n_clusters 值。 n_clusters有上限吗?
此外,有关解决方案的任何建议和建议都会非常有帮助。 提前致谢。
【问题讨论】:
-
您正在针对 k 进行优化,因此您可以在这里尝试一种与此类似的方法:stackoverflow.com/questions/53075481/…
标签: python machine-learning nlp cluster-analysis k-means