【问题标题】:how to cluster evolving data streams如何对不断发展的数据流进行聚类
【发布时间】:2011-04-05 03:16:53
【问题描述】:

我想以增量方式对文本文档进行聚类,将它们作为数据流读取,但似乎存在问题。大多数术语权重选项基于使用 TF-IDF 作为特征权重的向量空间模型。然而,在我们的例子中,现有属性的 IDF 会随着每个新数据点而变化,因此以前的聚类不再有效,因此任何流行的算法(如 CluStream、CURE、BIRCH)都不能应用,因为它们假定了固定维度的静态数据。 任何人都可以将我重定向到与此相关的任何现有研究或提供建议吗?谢谢 !

【问题讨论】:

    标签: algorithm machine-learning cluster-analysis information-retrieval tf-idf


    【解决方案1】:

    这是我头顶的想法:​​

    您的输入数据是什么样的?我猜这是至少类似的主题,所以你可以从一个基本短语词典中开始,在idf @。 @ 987654321是一个伟大的索引引擎。由于您有一个基本词典,您可以在您想要的@或任何您想要的内容@ 987654322。随着文件进来的,您必须以某种频率(可以关闭到另一个线程/机器/ etc),然后重新簇重建字典。

    使用像Lucene这样的高性能,灵活的发动机中索引的数据,即使正在索引新的文档也可以运行查询。我打赌,如果你在different clustering algorithms 987654323 @你会找到一些好主意。

    一些有趣的纸/链接:

    1. http://en.wikipedia.org/wiki/Document_classification
    2. http://www.scholarpedia.org/article/Text_categorization
    3. http://en.wikipedia.org/wiki/Naive_Bayes_classifier

    没有更多信息,我看不出为什么你不能偶尔每一次重新纳入。您可能想看看已经存在的一些推荐系统。

    【讨论】:

      【解决方案2】:

      【讨论】:

      猜你喜欢
      • 2016-04-04
      • 2017-01-28
      • 2018-12-08
      • 2019-11-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-05-14
      • 2015-02-11
      相关资源
      最近更新 更多