【问题标题】:Using variable length data inputs with EM algorithm clustering使用带有 EM 算法聚类的可变长度数据输入
【发布时间】:2015-11-18 19:30:29
【问题描述】:

我们有一组带有出租车位置的序列。我们希望通过考虑数据行中的顺序模式来对数据进行聚类。 例如: T1, T2, T3, T4 是行程,a,b,c,d,e 是一组地点。 我们拥有的数据是这样的,

  • T1 b c b a d
  • T2 一个
  • T3 a b a b a b c e d
  • T4 b c d c b d c a

但问题是数据的长度是不可变的。我们如何使用 EM 对这些类型的数据进行聚类。由于它不接受可变长度数据,因此我们可以自定义它。

【问题讨论】:

    标签: cluster-analysis data-mining sequential expectation-maximization


    【解决方案1】:

    EM 是一般原则。您可以将它与非常不同的模型一起使用。

    可能最流行的 EM 模型是 高斯混合建模,GMM。

    当然,如果你使用协方差,GMM 需要一个固定的维度。

    但是如果你使用其他模型,它没有理由不能使用可变长度向量。例如,有处理文本数据的 EM 变体,而文本通常确实有不同的长度。

    【讨论】:

      猜你喜欢
      • 2023-03-21
      • 1970-01-01
      • 2018-10-17
      • 2018-06-04
      • 2014-04-30
      • 2018-09-15
      • 2017-03-05
      • 2011-07-14
      • 2018-05-25
      相关资源
      最近更新 更多