【发布时间】:2021-05-18 12:20:42
【问题描述】:
我知道五种标准的无监督异常值检测方法:
- 概率模型
- 基于聚类的模型
- 基于距离的模型
- 基于密度的模型
- 时间序列异常值检测模型
但是隔离森林是什么类型的呢?根据谷歌它是一个“基于树的模型”,但是否也可以说隔离森林是一个基于距离的模型?
【问题讨论】:
标签: scikit-learn scikits
我知道五种标准的无监督异常值检测方法:
但是隔离森林是什么类型的呢?根据谷歌它是一个“基于树的模型”,但是否也可以说隔离森林是一个基于距离的模型?
【问题讨论】:
标签: scikit-learn scikits
虽然 Anomaly detection's wikipedia page 声明它是 Density-based technique,但您应该参考 the original paper 和 Scikit-learn 文档。
Isolation forest 对于异常检测确实很有用,对于大型数据集尤其有效。它由树形结构表示,并假设它使用recursive partitioning,the number of splittings required to isolate a sample is equivalent to the path length from the root node to the terminating node.
除了Scikit-learn docs中提供的所有详细信息,您还可以阅读source paper:
除了隔离与剖析的关键区别外,iForest 在以下方面与现有的基于模型、基于距离和基于密度的方法不同:
- iTree 的隔离特性使它们能够 构建部分模型并利用子采样 在现有方法中不可行的程度。自从 隔离法线点的 iTree 的很大一部分是 不需要异常检测;它不需要 被建造。小样本量产生更好的效果 iTrees,因为淹没和掩蔽效果是 减少。
- iForest 不使用距离或密度测量来检测异常。这消除了主要的计算 所有基于距离的方法和基于密度的方法中的距离计算成本。
- iForest 具有线性时间复杂度和低 恒定和低内存要求。对我们的 最好的知识,最好的现有方法 仅实现近似线性时间复杂度 高内存使用率。
- iForest 具有扩展能力以处理极其 大数据量和高维问题 大量不相关的属性。
【讨论】: