【发布时间】:2015-07-23 03:00:49
【问题描述】:
请帮忙
我想提供一个简单的框架来识别和清理上下文大数据中的重复数据。此预处理必须实时执行(流式传输)。
我们通过一个 file.csv 来表示我们的数据库,这个文件包含没有重复的患者(医疗)记录。
我们想通过对混合的分类和数值使用增量并行 k 均值聚类将 file.csv 聚类为 4 个聚类,每个聚类包含相似的记录。
每次(数据流)结构化数据来(记录)时,我们必须将其与集群的代表(M1,M2,M3,M4)进行比较............ 如果数据不代表重复数据,我们将其保存在 file.csv 中,如果它表示重复数据,则不保存在 file.csv 中。
1)那么在我的情况下,hadoop 或 spark 的高效工具是什么! 2) 我如何使用 Mlib(spark) 或 mahout (hadoop) 实现混合分类和数值的聚类。 3) 增量聚类是什么意思,流式聚类是什么意思!
【问题讨论】:
标签: apache-spark cluster-analysis data-mining k-means spark-streaming