【问题标题】:Irregular/missing data when clustering time series聚类时间序列时数据不规则/缺失
【发布时间】:2020-06-06 03:59:22
【问题描述】:

无论是动态时间扭曲还是时间序列的某种欧几里德 k 均值聚类,(几乎?)总是需要考虑不规则的数据间距、不等长的数据和/或数据缺失.

虽然意识到这些问题中的每一个都有其自身的考虑因素,但是否有一个普遍的原因为什么无法使用样条对每个时间序列进行预处理以内插(或极少外推)数据以改善这些问题?

【问题讨论】:

    标签: python r time-series cluster-analysis spline


    【解决方案1】:

    我不明白为什么不。我认为要考虑的主要事情是您所做的假设。至少对我而言,这种程序想到的假设是

    1. 样条曲线可以充分描述(平滑)每个时间序列,并捕捉它们之间的差异。

    2. 聚类过程的输入描述了样条曲线之间的真实差异,因此也描述了时间序列。

    聚类过程的输入可以是估计的样条函数或样条的系数。当然,估计的系数会更容易使用,但您需要确保它们之间的差异真正代表样条函数的差异。这可能归结为样条的基函数的正交性,但我不确定是否存在支持这一点的理论。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-04-23
      • 2019-03-18
      • 1970-01-01
      • 1970-01-01
      • 2016-11-21
      • 1970-01-01
      • 2021-05-25
      • 2022-01-06
      相关资源
      最近更新 更多