【问题标题】:k mean clustering for mixed categorical and numeric value混合分类和数值的 k 均值聚类
【发布时间】:2015-07-23 03:00:49
【问题描述】:

请帮忙

我想提供一个简单的框架来识别和清理上下文大数据中的重复数据。此预处理必须实时执行(流式传输)。

我们通过一个 file.csv 来表示我们的数据库,这个文件包含没有重复的患者(医疗)记录。

我们想通过对混合的分类和数值使用增量并行 k 均值聚类将 file.csv 聚类为 4 个聚类,每个聚类包含相似的记录。

每次(数据流)结构化数据来(记录)时,我们必须将其与集群的代表(M1,M2,M3,M4)进行比较............ 如果数据不代表重复数据,我们将其保存在 file.csv 中,如果它表示重复数据,则不保存在 file.csv 中。

1)那么在我的情况下,hadoop 或 spark 的高效工具是什么! 2) 我如何使用 Mlib(spark) 或 mahout (hadoop) 实现混合分类和数值的聚类。 3) 增量聚类是什么意思,流式聚类是什么意思!

【问题讨论】:

    标签: apache-spark cluster-analysis data-mining k-means spark-streaming


    【解决方案1】:

    正如已经在 SO/CV 上多次指出的那样:

    k-means 计算 means

    除非您可以为分类数据定义最小二乘均值(在实践中仍然有用),否则对此类数据使用 k-means 是行不通的。

    当然,您可以进行一次性编码和类似的 hack,但它们会使结果变得毫无意义。对于二进制输入数据,“最小二乘”不是一个有意义的目标。

    KMeans dealing with categorical variable

    Why am I not getting points around clusers in this kmeans implementation?

    https://stats.stackexchange.com/questions/58910/kmeans-whether-to-standardise-can-you-use-categorical-variables-is-cluster-3

    【讨论】:

      猜你喜欢
      • 2020-12-18
      • 2014-07-24
      • 2017-02-15
      • 2015-02-09
      • 2017-12-30
      • 2019-05-04
      • 2017-01-15
      • 2012-06-18
      • 2019-10-14
      相关资源
      最近更新 更多