【问题标题】:Is Isolation Forest a Distance-Based Model?隔离森林是基于距离的模型吗?
【发布时间】:2021-05-18 12:20:42
【问题描述】:

我知道五种标准的无监督异常值检测方法:

  • 概率模型
  • 基于聚类的模型
  • 基于距离的模型
  • 基于密度的模型
  • 时间序列异常值检测模型

但是隔离森林是什么类型的呢?根据谷歌它是一个“基于树的模型”,但是否也可以说隔离森林是一个基于距离的模型?

【问题讨论】:

    标签: scikit-learn scikits


    【解决方案1】:

    虽然 Anomaly detection's wikipedia page 声明它是 Density-based technique,但您应该参考 the original paper 和 Scikit-learn 文档。

    Isolation forest 对于异常检测确实很有用,对于大型数据集尤其有效。它由树形结构表示,并假设它使用recursive partitioning,
    the number of splittings required to isolate a sample is equivalent to the path length from the root node to the terminating node.

    除了Scikit-learn docs中提供的所有详细信息,您还可以阅读source paper

    除了隔离与剖析的关键区别外,iForest 在以下方面与现有的基于模型、基于距离和基于密度的方法不同:

    1. iTree 的隔离特性使它们能够 构建部分模型并利用子采样 在现有方法中不可行的程度。自从 隔离法线点的 iTree 的很大一部分是 不需要异常检测;它不需要 被建造。小样本量产生更好的效果 iTrees,因为淹没和掩蔽效果是 减少。
    1. iForest 不使用距离或密度测量来检测异常。这消除了主要的计算 所有基于距离的方法和基于密度的方法中的距离计算成本。
    1. iForest 具有线性时间复杂度和低 恒定和低内存要求。对我们的 最好的知识,最好的现有方法 仅实现近似线性时间复杂度 高内存使用率。
    1. iForest 具有扩展能力以处理极其 大数据量和高维问题 大量不相关的属性。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-09-10
      • 2019-07-11
      • 2019-06-29
      • 2020-11-16
      • 2019-08-02
      • 1970-01-01
      • 2019-07-20
      • 2017-08-21
      相关资源
      最近更新 更多