【发布时间】:2011-04-05 03:16:53
【问题描述】:
我想以增量方式对文本文档进行聚类,将它们作为数据流读取,但似乎存在问题。大多数术语权重选项基于使用 TF-IDF 作为特征权重的向量空间模型。然而,在我们的例子中,现有属性的 IDF 会随着每个新数据点而变化,因此以前的聚类不再有效,因此任何流行的算法(如 CluStream、CURE、BIRCH)都不能应用,因为它们假定了固定维度的静态数据。 任何人都可以将我重定向到与此相关的任何现有研究或提供建议吗?谢谢 !
【问题讨论】:
标签: algorithm machine-learning cluster-analysis information-retrieval tf-idf